{"as_of":"2026-08-24T01:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88ecd3177f22cbca7e84c880d3ac50b6cc36c907ee309e818bc8a93da7eddc0b","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:45:46.037186Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:03:16.449710Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:56:24.412552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14738","snapshot_observed_at":"2026-08-04T23:03:16.449710Z","title":"Parameswaran","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06838","last_updated":"2025-09-08T16:08:31Z","snapshot_observed_at":"2026-08-09T03:57:38.609026Z","submitted_at":"2025-09-08T16:08:31Z","title":"EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:03:16.449710Z"},"links":{"cited_paper":"/paper/2504.14738","citing_paper":"/paper/2509.06838"},"observation_digest":"sha256:cc800f51f9c3229b93020220de148fce9b73218f7b2dd7ef75021e88b6387205","observation_id":"31d48f05-84c0-4215-bce6-fd27eac3e6e0","resolution":{"observed_at":"2026-08-04T23:03:16.449710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"cited_work":{"arxiv_id":"2504.14738","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14738","snapshot_observed_at":"2026-07-02T00:56:24.412552Z","title":"PROMPTEV ALS: A dataset of assertions and guardrails for custom production large language model pipelines,","venue":null,"work_id":"76ec1c18-a7e1-4a08-b20a-6dbe545d16f2","year":2025},"citing_paper":{"arxiv_id":"2606.01513","last_updated":"2026-06-01T00:24:30Z","snapshot_observed_at":"2026-08-07T00:02:03.501606Z","submitted_at":"2026-06-01T00:24:30Z","title":"Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T13:13:05.210457Z"},"links":{"cited_paper":"/paper/2504.14738","citing_paper":"/paper/2606.01513"},"observation_digest":"sha256:9ca6b9ae7b7d910e6e983932ea60bacf4f2e20d4bf6a5680771472a9507b1576","observation_id":"7059f1bb-5aca-4c30-bd09-a8857d04b99b","resolution":{"observed_at":"2026-07-02T00:56:24.414603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14738/citation-record","integrity":"/paper/2504.14738/integrity","json":"/paper/2504.14738/citation-record.json","paper":"/paper/2504.14738"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.598024Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.598024Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:86f718f9be835b2cdb6bd5cee439fa91914d25b8f4343de0ac8f0da3207a1eae","observation_id":"b901b01a-4ed9-4edf-8167-b58710e01634","resolution":{"observed_at":"2026-08-16T11:45:45.598024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.604047Z","title":"A survey on evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.604047Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:488c350b8c3d95c8b64277b9b3b71fcd2ccf0ffbe242228102cb75008a3ec564","observation_id":"f5ff3c12-5408-45fb-a58d-8e2c86064f5f","resolution":{"observed_at":"2026-08-16T11:45:45.604047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.527615Z","title":"Benchmarking large language models in retrieval- augmented generation","venue":null,"work_id":"c1d54ab0-aaed-47e9-9bce-415edcdc837e","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.610178Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4f6fc00a22977e47436d72b8ccdb78c57246e47f6dd0fcfc467ead7b52bca0ae","observation_id":"488a3918-316b-4607-8253-81497ef95174","resolution":{"observed_at":"2026-08-16T11:45:47.532964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-08-18T19:51:48.688199Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-16T11:45:45.615201Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.615201Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c9c5dfc486ed437da660ca2ff4a8dde1a2b44079f542ad95c4dafae30592d9af","observation_id":"ae44640f-54c0-42ad-8b8d-c6c75d58a771","resolution":{"observed_at":"2026-08-16T11:45:45.615201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:45:45.625992Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.625992Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:db6e20a806a3be9fff0c322883acb9d5dcc582baae74d537cc021eb02c727164","observation_id":"3e65baf5-0e50-4cb5-8077-dfbe9a491c7b","resolution":{"observed_at":"2026-08-16T11:45:45.625992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.631360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.631360Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:08b7c5c111a52e81908a87410f6b39dbc9fec5adb0de9585ebb8e02c45123aa8","observation_id":"efe3e18c-47ac-439e-b8e5-40d3605ef91a","resolution":{"observed_at":"2026-08-16T11:45:45.631360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.493787Z","title":"Building guardrails for large language models, 2024","venue":null,"work_id":"88026f01-851d-4eef-888c-da2f21818cd0","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.636201Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:bf2b71e1247d11f47139427fad7f28b5ea36f1db57d32e1722014977c9a36c2d","observation_id":"b7c47f3c-b09d-4a1a-8492-6ef813bf6831","resolution":{"observed_at":"2026-08-16T11:45:47.498491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.477346Z","title":"Position: Building guardrails for large lan- guage models requires systematic design","venue":null,"work_id":"432fe2b3-a9db-4a23-b93d-923991a9a5eb","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.640898Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:7e97d0dcb1a5ad0bbadb8c633b90037f0df68219ff06f74d33abb8d4a182172f","observation_id":"79d0aa8e-347a-4190-9b11-0622c6381185","resolution":{"observed_at":"2026-08-16T11:45:47.482570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18322","last_updated":"2024-09-04T17:16:05Z","snapshot_observed_at":"2026-08-16T13:37:58.348497Z","submitted_at":"2024-07-01T19:52:41Z","title":"The Need for Guardrails with Large Language Models in Medical Safety-Critical Settings: An Artificial Intelligence Application in the Pharmacovigilance Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18322","snapshot_observed_at":"2026-08-16T11:45:45.646404Z","title":"The need for guardrails with large language models in medical safety-critical settings: An artificial intelli- gence application in the pharmacovigilance ecosys- tem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.646404Z"},"links":{"cited_paper":"/paper/2407.18322","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:7d39d7088063fcab893ada4b39dc72f99035714792e80b539d21e98779ad3d7c","observation_id":"06ce5c9a-9035-4956-b1e2-870a58381542","resolution":{"observed_at":"2026-08-16T11:45:45.646404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T11:45:45.651292Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.651292Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:152de63aa5781c4d17402ee002c9f14ee1ff9bc550cace443fe76451c11e9f47","observation_id":"f5278d8e-716f-458d-a024-8f3a3e7798bc","resolution":{"observed_at":"2026-08-16T11:45:45.651292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.661717Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.661717Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4e0dcc5e9600a2c66332cbd30a9770ec61a2a25866fb2ba2d173d0da1ffa4c85","observation_id":"ad2f9335-2a42-4c3b-97cd-50c8ca27ec14","resolution":{"observed_at":"2026-08-16T11:45:45.661717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-16T11:45:45.666259Z","title":"A survey on hallucination in large language models: Principles, taxonomy, chal- lenges, and open questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.666259Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:ed780e5653ce45ae86c991a9e153c1cdc0c73c8198dc6f3221c357457e169ed5","observation_id":"a5d4ff67-f162-466b-bc8f-2028ad529c15","resolution":{"observed_at":"2026-08-16T11:45:45.666259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.676124Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.676124Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:93d0a519d84594a49cbcb6a2dfa14b44dc9cf1e154a99de63b2a671405511599","observation_id":"1e003537-e495-4ca0-8d84-d5e293686b79","resolution":{"observed_at":"2026-08-16T11:45:45.676124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07207","last_updated":"2022-03-08T06:47:17Z","snapshot_observed_at":"2026-08-20T01:44:55.318386Z","submitted_at":"2022-01-18T18:59:45Z","title":"Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07207","snapshot_observed_at":"2026-08-16T11:45:45.680628Z","title":"Abbeel, Deepak Pathak, and Igor Mordatch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.680628Z"},"links":{"cited_paper":"/paper/2201.07207","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:95c70c59dc6381e870ecfce844e693022d2163781c86a40e2acc0d4038015512","observation_id":"36e3c33a-0e1e-4dae-b339-85e612accfd8","resolution":{"observed_at":"2026-08-16T11:45:45.680628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.384507Z","title":"Beavertails: To- wards improved safety alignment of llm via a human- preference dataset","venue":null,"work_id":"f57c6b23-2a22-44bd-8f29-4caba852500a","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.690667Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:154b063e09751e4067cb85c2424b5042590dd6f4ed1130ab2096b3ff945abd08","observation_id":"5e530c0d-f3ab-4900-ae0c-e65e7684a19c","resolution":{"observed_at":"2026-08-16T11:45:47.389839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.368528Z","title":null,"venue":null,"work_id":"df50f0d9-c6d8-4cbd-bd76-57fa085ca571","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.695378Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b1063dbe5bddf280752470999520106038effa5c52f2080f99974a3b857b0647","observation_id":"d1f83626-c98c-457f-a058-689473bb5c2d","resolution":{"observed_at":"2026-08-16T11:45:47.373470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14648","last_updated":"2024-03-20T02:21:20Z","snapshot_observed_at":"2026-08-21T13:43:29.084171Z","submitted_at":"2023-11-24T18:29:50Z","title":"Calibrated Language Models Must Hallucinate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14648","snapshot_observed_at":"2026-08-16T11:45:45.700412Z","title":"Cal- ibrated language models must hallucinate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.700412Z"},"links":{"cited_paper":"/paper/2311.14648","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9fa6b77c84ea5cd4a8e0c15a56c29e5f748e1ca3c606174fd5faeb009da1ffdb","observation_id":"3720bc09-8959-4fd2-9358-e9048911c4a6","resolution":{"observed_at":"2026-08-16T11:45:45.700412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.401950Z","title":null,"venue":null,"work_id":"779d49c4-23b2-4296-9235-663981d6e85f","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.685736Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9ad2e19b137516e3b2e49df7798b9bd72a71fe1aee391693178d47d63fcc1710","observation_id":"8e8fa19b-e235-4fe7-9ce3-7e752b768eda","resolution":{"observed_at":"2026-08-16T11:45:47.408977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.350463Z","title":"Prometheus: Inducing fine-grained evaluation capa- bility in language models","venue":null,"work_id":"7a660bbc-0959-4b3b-a1ba-33b01acc086b","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.710859Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:e55391c35b4152c565c8e09ca471584bc92d2f59a4219b6781dd5d1406cd6418","observation_id":"e0c8dc2e-15ba-4271-ba5f-716384b8a77c","resolution":{"observed_at":"2026-08-16T11:45:47.356131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-16T11:45:45.715779Z","title":"Prometheus 2: An open source language model specialized in evaluating other language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.715779Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:70568ae73f4839a0261f214d58fa54537253ed496ea3fbae8fa40244c350da2a","observation_id":"f0e28339-24c1-4110-8269-34221fde98fb","resolution":{"observed_at":"2026-08-16T11:45:45.715779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.332808Z","title":"Evallm: Interactive evaluation of large language model prompts on user-defined cri- teria","venue":null,"work_id":"b05a37b5-fc7c-4d41-9163-8e47d966bd0e","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.722034Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:dce007e8c1474ea8f166a19cc0db23c41a35e68840e256fab718bab418141224","observation_id":"d1716994-9a5c-4db6-b47a-946941e86fdf","resolution":{"observed_at":"2026-08-16T11:45:47.338952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-16T11:45:45.705973Z","title":"Dspy: Compiling declarative language model calls into self-improving pipelines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.705973Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:833c3bb63add5dcf31bd21b43332b555347ad8ffc99aaced4ec6828ce6da0d07","observation_id":"274f6e81-4c26-4c67-b168-473a6b47cc06","resolution":{"observed_at":"2026-08-16T11:45:45.705973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.314719Z","title":"Openassistant conversations- democratizing large language model alignment","venue":null,"work_id":"2cd605d1-eb91-4e77-8ef3-bab780589ea7","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.732360Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4abc563b07f5257d33c3ce49ce17819f0d5ae42dbc501c1db02f71dba686d702","observation_id":"0e832080-5ac4-4fd8-8160-81f268867e7f","resolution":{"observed_at":"2026-08-16T11:45:47.320144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.737081Z","title":"The power of scale for parameter-efficient prompt tuning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.737081Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:25c6222130d32494b325e54f64b788c996d5d34dbc7229655f5da7dc17710161","observation_id":"8dc9c929-ac88-4ff2-8750-43c3ba4acf12","resolution":{"observed_at":"2026-08-16T11:45:45.737081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-21T11:07:08.318331Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-16T11:45:45.742303Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.742303Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9cb2949f3fc2e1fe20ef41b92930f2e390e712cc73d51944a81226941dfc2bd8","observation_id":"6536f886-cbc8-4ebe-bc2e-339586c5b769","resolution":{"observed_at":"2026-08-16T11:45:45.742303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-21T01:37:45.112714Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-16T11:45:45.727076Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.727076Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:13e1d6cd05c24d6c024596d690c905f69a124faddf5418b8c7d1ca7b779715e4","observation_id":"f94e8bd8-78a9-429c-a1f5-a997529424f1","resolution":{"observed_at":"2026-08-16T11:45:45.727076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.757425Z","title":"we need structured output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.757425Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:770aed45af99cf57ded01e541db07fae6eb9755004e62f036545f4d7cc33f439","observation_id":"3180c99d-4c35-4a7e-958c-f08bd0d8ed48","resolution":{"observed_at":"2026-08-16T11:45:45.757425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-20T10:21:12.032735Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-16T11:45:45.762328Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.762328Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4cfcbe0cb6f0969faa1e964779d547530ffa31d11e49b3dd2ca75992f3ef096a","observation_id":"3663e3a0-a886-4c6b-a139-d7844988bbf1","resolution":{"observed_at":"2026-08-16T11:45:45.762328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.772647Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.772647Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:2cec7bf91e50527ee446a25e8576213bbaad12925d9454f609b13b6d077a123e","observation_id":"b3d22441-5c7f-43dc-a969-af498014db4e","resolution":{"observed_at":"2026-08-16T11:45:45.772647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.286375Z","title":null,"venue":null,"work_id":"e4ebcda6-f396-4c5d-ab18-1094cd4e0724","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.747693Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:fb998a5838eaa135081f997f651eee8e1f9fe654584484bfe646b29704fe7f2e","observation_id":"619be15f-e175-44ef-bb9e-28a74e900633","resolution":{"observed_at":"2026-08-16T11:45:47.291139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-21T16:24:51.670091Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-16T11:45:45.752370Z","title":"Prefix-tuning: Op- timizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.752370Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:896d5c674d45c452a007a682f6c40f79469a64b362c3503cc6084e8ccafb5165","observation_id":"210b601d-7eac-4dc7-b26d-3a8e452fc914","resolution":{"observed_at":"2026-08-16T11:45:45.752370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T11:45:45.787280Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.787280Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:8548a23757bca861efcd66d5b3a5e8f6c4ed3b9a4b50d15a5f1374fda9457698","observation_id":"f79ed5c4-1b2b-486a-a34b-9990610a5bbd","resolution":{"observed_at":"2026-08-16T11:45:45.787280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03188","last_updated":"2023-08-30T03:47:34Z","snapshot_observed_at":"2026-08-20T12:39:07.380714Z","submitted_at":"2023-08-06T18:38:52Z","title":"Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03188","snapshot_observed_at":"2026-08-16T11:45:45.797125Z","title":"Automatically correcting large language models: Surveying the landscape of diverse self- correction strategies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.797125Z"},"links":{"cited_paper":"/paper/2308.03188","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c17c3bea75793bda7c176c35d97a1c3de5b6fdb1ce32b1da7a740c58213c4ccb","observation_id":"288860c4-71b6-4e34-9c4e-29dc77767097","resolution":{"observed_at":"2026-08-16T11:45:45.797125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.269854Z","title":null,"venue":null,"work_id":"cff87aa1-2f6d-4f9b-829f-cd7cc060f247","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.768012Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:155d8b79de4592ae218f571054d7b3d5d69a5af579cd0eb205c1dfd960d95933","observation_id":"4357f14c-b418-4627-857d-89978d5436bb","resolution":{"observed_at":"2026-08-16T11:45:47.275030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.207460Z","title":"Nemo guardrails: A toolkit for controllable and safe llm applications with programmable rails, 2023","venue":null,"work_id":"60ccfeb0-14dd-494d-9bd3-51368cbac2ba","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.811054Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:23c954290605196a641c1ad101f27c0b43a9275b7e4ffc2c19683505e4ae3bf9","observation_id":"d22336fe-8408-4966-b786-98575d1ca461","resolution":{"observed_at":"2026-08-16T11:45:47.212247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01452","last_updated":"2024-07-24T15:53:29Z","snapshot_observed_at":"2026-08-20T06:03:25.485156Z","submitted_at":"2024-07-24T15:53:29Z","title":"Building a Domain-specific Guardrail Model in Production","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01452","snapshot_observed_at":"2026-08-16T11:45:45.777364Z","title":"Building a domain-specific guardrail model in pro- duction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.777364Z"},"links":{"cited_paper":"/paper/2408.01452","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:8e8f8fcabb12adec27b180b2b5c8b07d0b382d5a8f832ddc2deb4232d1ad2c94","observation_id":"dbf368e9-f11e-4258-bb31-b99b4dea5e95","resolution":{"observed_at":"2026-08-16T11:45:45.777364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:45:45.782427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.782427Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:2c0e2ad941de7e193393c0188b445318cab72712370efbe4b4f5d4bb008796c4","observation_id":"6edcdd71-a4cb-438c-a234-20fc26ab71b6","resolution":{"observed_at":"2026-08-16T11:45:45.782427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12272","last_updated":"2024-04-18T15:45:27Z","snapshot_observed_at":"2026-08-20T21:06:18.098294Z","submitted_at":"2024-04-18T15:45:27Z","title":"Who Validates the Validators? Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12272","snapshot_observed_at":"2026-08-16T11:45:45.825085Z","title":"Who validates the validators? aligning llm-assisted evaluation of llm outputs with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.825085Z"},"links":{"cited_paper":"/paper/2404.12272","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:da3566294cc470534aaad56d136f561d5b45fb678306af88d7a1bfb6e5ed702f","observation_id":"44b15ade-cfe4-4a99-9b08-a22b21cbd5ff","resolution":{"observed_at":"2026-08-16T11:45:45.825085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.239361Z","title":null,"venue":null,"work_id":"804dc806-4b1b-4c15-a201-8654ea797565","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.792397Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:34c5c5cc6ec74d8d484ae13b7e978be28caacbbf543ced7fd2220687048cede0","observation_id":"e24694fc-c858-46a5-a4a6-d3e6c7d1a4f7","resolution":{"observed_at":"2026-08-16T11:45:47.244480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-16T11:45:45.834521Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.834521Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:46a55f7f6fd735f1541f860aedcf1bbeb4aed9b6a36b8c2fb2de0d8723d05952","observation_id":"56bf4edd-bab2-4968-a5ca-d04e052f6cee","resolution":{"observed_at":"2026-08-16T11:45:45.834521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.223361Z","title":null,"venue":null,"work_id":"579804c9-576a-4327-8651-7cd0ca2ed1af","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.801812Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9d4398ed3815f18043ccddf2029f5fe9d5a54439a5e538c9371dc23d0290419c","observation_id":"53d0e489-b290-49b4-b232-b077b7969025","resolution":{"observed_at":"2026-08-16T11:45:47.228112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03601","last_updated":"2024-01-07T23:01:56Z","snapshot_observed_at":"2026-08-21T00:10:56.440464Z","submitted_at":"2024-01-07T23:01:56Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03601","snapshot_observed_at":"2026-08-16T11:45:45.806425Z","title":"Infobench: Eval- uating instruction following ability in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.806425Z"},"links":{"cited_paper":"/paper/2401.03601","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:0ff0537222185f25a99ca3ba2884a1fe8a48436e7ad2d4b2841719c7d826643a","observation_id":"a781cdcd-9cec-4530-b146-04143e365e7a","resolution":{"observed_at":"2026-08-16T11:45:45.806425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-16T11:45:45.853992Z","title":"Pandalm: An automatic evaluation benchmark for llm instruc- tion tuning optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.853992Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:64d355e2910ec1bf511476caca9cd5e6c4433330448cef6212a00636517092de","observation_id":"6196b8d1-9e22-4a3a-9b08-9494653f8cda","resolution":{"observed_at":"2026-08-16T11:45:45.853992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-16T11:45:45.815644Z","title":"A systematic survey of prompt engineering in large lan- guage models: Techniques and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.815644Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:523943faff104a7f73ad70204434cd1d784d194d0709a77dfbadacb269cd6771","observation_id":"6b3f1be4-9cfb-4a50-a81b-f077668b6dc1","resolution":{"observed_at":"2026-08-16T11:45:45.815644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.191197Z","title":null,"venue":null,"work_id":"38bf8e87-e93a-4fe6-a87f-29dd6091b593","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.820510Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:689a4d05d82d3204e97b2331d19d4070db27e811c07d2cc8ca40dec136bbe594","observation_id":"526f8b7d-9bbc-4864-bbfa-8fe6fa4d1f69","resolution":{"observed_at":"2026-08-16T11:45:47.196931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.091128Z","title":"Chain-of-thought prompting elicits rea- soning in large language models","venue":null,"work_id":"43e187ea-d8c2-46a7-b235-85aaf544bc33","year":2022},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.874816Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:f5117bb00986d1bbe01829b160ce8731561057d0520b13a2f5c953a229b53580","observation_id":"0e71b4f6-d5a0-4e40-8339-9e39560a161b","resolution":{"observed_at":"2026-08-16T11:45:47.096334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.829858Z","title":"Towards better evaluation of instruction-following: A case-study in summariza- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.829858Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:76e69a04fb7c2b9bb86f32116468e79abf54191ce0f26716d30f687c5aaae27e","observation_id":"177924f0-8eb1-4319-9b61-26e81e901105","resolution":{"observed_at":"2026-08-16T11:45:45.829858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.885020Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.885020Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:ae4ba3c2a3a18a45c6d7b6457c8875d1478cf06fd1982ec5924d839f84c9bb4e","observation_id":"39f165bc-fc5c-4462-ae7e-99357d4bef12","resolution":{"observed_at":"2026-08-16T11:45:45.885020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.174212Z","title":null,"venue":null,"work_id":"46b74d28-f04a-4e2e-9706-d07b31b1e308","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.839730Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:149f978a453eb2c50f961dd752fbc3c73f3caf73884045b331a02f14ad0bdd90","observation_id":"133beb70-e2ad-4713-a13f-91bda165f224","resolution":{"observed_at":"2026-08-16T11:45:47.178942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.158219Z","title":"Llama: Open and efficient foundation language mod- els, 2023","venue":null,"work_id":"8f3052ae-ebaa-40bf-91ef-f67cbb155735","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.844536Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:d36283fd29c2c4a8bb2f011344c70b85bb221242cb759c1029d39692cdb80327","observation_id":"135fee25-b8ff-4b08-8f6c-1c2e3bb68252","resolution":{"observed_at":"2026-08-16T11:45:47.163088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.141093Z","title":"Replacing judges with juries: Evaluating llm genera- tions with a panel of diverse models, 2024","venue":null,"work_id":"112eecd1-f253-4b1f-ab43-1042e4143638","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.849158Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:32948387bc49c6b455cbbd2e475f1d46546facb7af74ffb22936d2bca84e906e","observation_id":"6fac03f7-f32e-43d3-9057-4cc1acc73170","resolution":{"observed_at":"2026-08-16T11:45:47.146168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T11:45:45.908023Z","title":"Instruction-following evalu- ation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.908023Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c2cc45bf9d63b18f814672657a045f34cd596a9d451cc3d9837a435a0fe6aa0a","observation_id":"8bf6f4d6-3eab-4498-ae9d-106f9a2f8fb5","resolution":{"observed_at":"2026-08-16T11:45:45.908023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.125298Z","title":null,"venue":null,"work_id":"363e5b5e-c658-4958-8ee0-01531339fb15","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.859420Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:550c65b8dfe82905261585b9e6ebe2140c813df11e2b1c81c49623ba6e26abfa","observation_id":"a552e413-4851-41a2-a4aa-7014270cb7de","resolution":{"observed_at":"2026-08-16T11:45:47.130133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.106886Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"523ce473-91f9-4990-9a69-a5bb42e4a42e","year":2022},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.865143Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:830ed4200dcdc0af3dc52971409f3a205d6f9eb1aa328a704ea228ee39c17434","observation_id":"1c7a7725-7b20-4c95-a622-f23cf3caa8fd","resolution":{"observed_at":"2026-08-16T11:45:47.112691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-16T11:45:45.870237Z","title":"Dai, and Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.870237Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:72398b5d352babca4b29e748609048d13ce66cfcbfd602343b1b18d5e8dfd8ee","observation_id":"c86f39ce-a741-45bd-ad4f-452d10ca4f97","resolution":{"observed_at":"2026-08-16T11:45:45.870237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.074426Z","title":"Evaluating large lan- guage models at evaluating instruction following","venue":null,"work_id":"172bdd6b-a950-4aab-ad8b-8a4d5bba6aa2","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.879618Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c87790ba88b52d97b057b720a93cee0e864509cd8195f93d1bae3793ad892821","observation_id":"277e5ca9-9c84-4f16-84e0-8f05d7b10d73","resolution":{"observed_at":"2026-08-16T11:45:47.080012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-08-20T15:46:44.516034Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-16T11:45:45.889821Z","title":"Xing, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.889821Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:de84f9edbc502251f29701e2d2330e5d08c9d66849af8f2941f78bf3b1482dab","observation_id":"f9d903cb-e641-40d6-a474-0e9deace0733","resolution":{"observed_at":"2026-08-16T11:45:45.889821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.045089Z","title":null,"venue":null,"work_id":"edffb05d-bee6-4d34-b80a-81aa9d4e1b0c","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.894590Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6615f30ed58c543458c7e37cfb2a23bf1a560f3613db6bb8b342051dac703571","observation_id":"25fb6b3f-dad6-43fb-aca5-d7d1043a60da","resolution":{"observed_at":"2026-08-16T11:45:47.050199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.029854Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"02cdeb07-d4e1-49fc-be20-22225aca3d12","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.898912Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:cca0d90b67091a3353daa1360d54c61a13ebaa24f524c0cb584ac189edd0cde4","observation_id":"7721e4c3-07b5-4062-8890-28b857b88ca4","resolution":{"observed_at":"2026-08-16T11:45:47.034762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T11:45:45.903551Z","title":"Xing, Hao- tong Zhang, Joseph Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.903551Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:089305e1a62b7a974071128471c8fe48c765e90978ce2b3314d8aafc79c502b0","observation_id":"2d461559-1043-4562-9b8c-84688af7088f","resolution":{"observed_at":"2026-08-16T11:45:45.903551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-18T04:53:42.954410Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-16T11:45:45.913862Z","title":"Judgelm: Fine-tuned large language mod- els are scalable judges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.913862Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4f79dfe51a69fbc435e91a8f36579bc900ba624fde013571f31ae22b926ceae9","observation_id":"309c28c3-d6aa-4bd5-8de6-3761cc7184f8","resolution":{"observed_at":"2026-08-16T11:45:45.913862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.013151Z","title":null,"venue":null,"work_id":"2643046b-9f6a-4eb1-85f8-ebe13d0a7447","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.919420Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:581647830272984ce7b11885f4b195334a3f9b67a5f29553e38434d248ec70ee","observation_id":"10b0f052-dad6-409e-b47d-feb2f0a22263","resolution":{"observed_at":"2026-08-16T11:45:47.018240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13304","last_updated":"2023-06-23T05:43:28Z","snapshot_observed_at":"2026-08-19T05:45:53.973699Z","submitted_at":"2023-06-23T05:43:28Z","title":"ToolQA: A Dataset for LLM Question Answering with External Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13304","snapshot_observed_at":"2026-08-16T11:45:45.925042Z","title":"‘json “‘ markers, with the key “field","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.925042Z"},"links":{"cited_paper":"/paper/2306.13304","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:e73e45ac75c5e270573ecce042bc771513c6a96f663e4fa122381c56bde4a698","observation_id":"79a0b9a5-63ee-4223-b57b-efb430a64e12","resolution":{"observed_at":"2026-08-16T11:45:45.925042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.996876Z","title":null,"venue":null,"work_id":"81e8e3b6-e13d-45f6-9c71-4f5e9b7807eb","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.930886Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:f06317293cdccad6f209bc00da47f14c9f5a304415a94ec3c54f6327b5b9c6a6","observation_id":"c0222959-098b-4808-b091-2c37d972ca3f","resolution":{"observed_at":"2026-08-16T11:45:47.002483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.979025Z","title":null,"venue":null,"work_id":"11ffcb36-2aba-4839-a472-1d1be8d8e23c","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.936349Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a76eec800d939fc941d3b99190970f3af35a58c848fa9263bff59878453f8bab","observation_id":"79b9c25e-d5ef-42a4-a1e5-3e61a6191a7b","resolution":{"observed_at":"2026-08-16T11:45:46.984432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.961029Z","title":"We removed any rows that resulted in 0 assertion criteria after the first step of our 3 step workflow","venue":null,"work_id":"04e7d29f-9933-4166-85b0-1d3509b0cba8","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.941690Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:17be94f8eb8b4c472529cb549b2ba46f417a5064d5963cb8dc98d4830825eeac","observation_id":"b897493f-b0fc-44bf-a391-aaa49cebde7e","resolution":{"observed_at":"2026-08-16T11:45:46.966264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.943841Z","title":"They can delete their prompts by submitting a delete request","venue":null,"work_id":"61558d0b-7fd5-4387-91ac-9c2478026982","year":2000},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.946586Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:60f8cc003c82184f823d60d59e12b3ae9e688e2cc6a4480ebf073ebb9a31d874","observation_id":"4ed307bc-c492-4f0d-8e49-fd2286ebe6b1","resolution":{"observed_at":"2026-08-16T11:45:46.948952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.927681Z","title":"D Model Cards D.1 Fine-tuned Mistral","venue":null,"work_id":"0f36e493-7b21-458e-a674-dffa34f4b1f5","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.951389Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b532a4317390bad98fd053581dd1d28e023b4927a6f7c70ad804665311832e2f","observation_id":"1e4a96fd-d21f-4a95-98bf-ad1eb6f373d6","resolution":{"observed_at":"2026-08-16T11:45:46.933049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.823618Z","title":null,"venue":null,"work_id":"9170d59d-c30b-4d45-be60-3dac1a91494e","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.985574Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b7637ff4b06b531e186b62523ffb3835a8fc65bb071a3a09fdde2ffbaea7c474","observation_id":"d6c6ed5a-007d-4d52-aa74-52452fa2d3db","resolution":{"observed_at":"2026-08-16T11:45:46.828499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.789610Z","title":null,"venue":null,"work_id":"17a4d006-9586-4fba-9baf-a904342e5159","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.995064Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6c628af4b41410716b2852aab98e0fd3fa3f10574d43535b46380d481d0f08b2","observation_id":"d98f6bd3-88a5-4f31-a726-d240cdac249b","resolution":{"observed_at":"2026-08-16T11:45:46.794475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:45:45.999802Z","title":"Basic information about the model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.999802Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:5de2b8502971851e65af4611d7ac72d4a725153c4bfa9eef3e7e6968539297a5","observation_id":"bffc8536-63f3-4650-b3d8-b390c0d1fb80","resolution":{"observed_at":"2026-08-16T11:45:45.999802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.910394Z","title":"Use cases that were envisioned during development","venue":null,"work_id":"81963a15-4cf9-4c60-a6ee-92de2639408c","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.004533Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:60a67e713e7a26c845d00f9b9ddca4da7351952be58100259e7a612fc4601509","observation_id":"5d760eae-b7c6-4f44-bc33-d5456cd46f21","resolution":{"observed_at":"2026-08-16T11:45:46.915880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.893595Z","title":"Factors could include demographic or phenotypic groups, environmental conditions, techni- cal attributes, or others listed in Section 4.3","venue":null,"work_id":"30c576a4-51d5-4d1f-96c7-f3597a8c3cf7","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.009056Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:bee22994d8a508cc7c6048db25f85c9055f7671889ba7781a406956896cc878c","observation_id":"6e18393f-72c6-4857-9875-baf4f53e1d56","resolution":{"observed_at":"2026-08-16T11:45:46.898673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.876017Z","title":"Metrics should be chosen to reflect potential realworld impacts of the model","venue":null,"work_id":"487776f7-0bbe-4be2-8e57-b8a56075d169","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.013723Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:70cafcc7dd5614804a5b86a9d7562c0637b85447eac75f1ab664b1cfee7099e2","observation_id":"e9563528-c2b1-4830-b174-3be16e235ba5","resolution":{"observed_at":"2026-08-16T11:45:46.882845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.857617Z","title":null,"venue":null,"work_id":"b1dd3b38-e881-4bb8-8675-df0b03c8d0c7","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.018747Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:5cc931d258bb2515ba42fccd426b639b0caae22af597f78a6fc30c76209bd45e","observation_id":"32faf122-e630-4217-840b-bf1b8024aaf3","resolution":{"observed_at":"2026-08-16T11:45:46.862800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.840425Z","title":null,"venue":null,"work_id":"0c657cd9-ad94-4743-a3cb-8214f819aad6","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.023756Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:38ab8096251b4beef617be3fbc52b9682d3b8194227c57432bda9b419eca8295","observation_id":"740cbf64-9aed-4c1c-babf-4868c9362137","resolution":{"observed_at":"2026-08-16T11:45:46.845860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.772848Z","title":null,"venue":null,"work_id":"4df886f0-09b6-44f5-8901-0d3dd1df86f1","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.028136Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6d5335b74a292ff675765e6de8c22b2c28cf2834989980b9f7fc716a362c375a","observation_id":"427c3e6e-52f1-4ba9-adf3-ec842877cf5f","resolution":{"observed_at":"2026-08-16T11:45:46.777919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.807389Z","title":null,"venue":null,"work_id":"1d48d6ad-862a-4cf2-8e7b-de1a310bb1ce","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.032651Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:05a134e73c90bab5dc864299f97f45ef0163de29b4a8434b5cd5dd72013de70e","observation_id":"413abb1f-ae8f-4c20-adae-f81d6dea108a","resolution":{"observed_at":"2026-08-16T11:45:46.812413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.747067Z","title":null,"venue":null,"work_id":"b51f60e9-814d-42f0-8333-142c2603c8dd","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.037186Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:bf739bd0885fb5d6fd4a6c1c18ce2f3a2b6dc53a6a245a3545647388ff68a6e0","observation_id":"bc87f790-024a-4ed2-a5ff-9a007cec2fac","resolution":{"observed_at":"2026-08-16T11:45:46.754011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.460427Z","title":null,"venue":null,"work_id":"046ee91f-6f81-4192-82fe-44a69495ba9a","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.657044Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:1d27a0f98b141276268e9ccf8dd5756c127d5876b46e76c19d38bf996782735b","observation_id":"f47334ec-ab47-45df-9440-5b31a9a87084","resolution":{"observed_at":"2026-08-16T11:45:47.465252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.509988Z","title":null,"venue":null,"work_id":"9f0e1dfb-6342-49d1-8695-c21ac925c4a1","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.621062Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c82f36e21bead9cc389cfd5b11644068634ee0fc6553a5c457f96929e071692a","observation_id":"7c7a9835-2b75-4187-8d53-97a18fa92e35","resolution":{"observed_at":"2026-08-16T11:45:47.515350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.433772Z","title":null,"venue":null,"work_id":"ef8eb6c1-357b-4231-a610-0edb126fffbd","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.671082Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:7a2c8c1082f03831e46ab794f839f2663657bde38c8e7bb99595394dbff7d164","observation_id":"e786a326-ac76-40ca-abe2-1d95e563df32","resolution":{"observed_at":"2026-08-16T11:45:47.438874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T22:35:33.287077Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 2 inbound Pith citation observations for arXiv:2504.14738."}