{"as_of":"2026-08-19T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:614ab8112d5f0195dbdd9dc5d055d5c31b8e27570495e4da3b330eb8b9468985","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:01:22.032652Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:26.773582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:35:49.803600Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15298","snapshot_observed_at":"2026-08-06T20:43:26.773582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02173","last_updated":"2025-07-02T22:12:03Z","snapshot_observed_at":"2026-08-18T23:10:08.312871Z","submitted_at":"2025-07-02T22:12:03Z","title":"Data Diversification Methods In Alignment Enhance Math Performance In LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:26.773582Z"},"links":{"cited_paper":"/paper/2412.15298","citing_paper":"/paper/2507.02173"},"observation_digest":"sha256:35b4c3176b684978bd9e852f110eb9f924ae932c0ee0735887984171db276a31","observation_id":"9fda36b6-16e5-4f65-a47e-93d2b28a15bd","resolution":{"observed_at":"2026-08-06T20:43:26.773582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15298","snapshot_observed_at":"2026-08-06T17:03:24.474243Z","title":"Felix Stahlberg","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11966","last_updated":"2025-07-16T06:58:02Z","snapshot_observed_at":"2026-08-18T18:29:00.529541Z","submitted_at":"2025-07-16T06:58:02Z","title":"Toxicity-Aware Few-Shot Prompting for Low-Resource Singlish Translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:03:24.474243Z"},"links":{"cited_paper":"/paper/2412.15298","citing_paper":"/paper/2507.11966"},"observation_digest":"sha256:500c395c68695eb5330d100d59709f1737fe63210351f12bc523a9cd26a1ff55","observation_id":"6dc5b067-9875-4d2b-bd40-fa61ba0030e2","resolution":{"observed_at":"2026-08-06T17:03:24.474243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"cited_work":{"arxiv_id":"2412.15298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15298","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sarmah, K","venue":null,"work_id":"7182ce84-12f9-4bf0-ac18-d48cef98d4f3","year":2024},"citing_paper":{"arxiv_id":"2604.06403","last_updated":"2026-04-07T19:36:14Z","snapshot_observed_at":"2026-08-18T13:15:53.772040Z","submitted_at":"2026-04-07T19:36:14Z","title":"FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:43:18.106356Z"},"links":{"cited_paper":"/paper/2412.15298","citing_paper":"/paper/2604.06403"},"observation_digest":"sha256:8bfb731429f304249a06a3599c3a35158cac3287aa8434fde86c45c9ab4d2efd","observation_id":"783859c4-2f48-4371-9601-93430e7dd6e7","resolution":{"observed_at":"2026-05-10T22:35:49.809037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15298","snapshot_observed_at":"2026-08-02T11:09:22.275369Z","title":"A Comparative Study of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20497","last_updated":"2026-08-07T23:24:27Z","snapshot_observed_at":"2026-08-19T03:27:37.629004Z","submitted_at":"2026-06-15T23:39:06Z","title":"From Errors to Rules: Iterative Prompt Optimization for Text Classification","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T11:09:22.275369Z"},"links":{"cited_paper":"/paper/2412.15298","citing_paper":"/paper/2607.20497"},"observation_digest":"sha256:23fa353e8922e9a17215a45d7c968767d0bcc42b49a6098759294208cc4132cd","observation_id":"6a27738a-a448-4059-bf05-c18fee98723b","resolution":{"observed_at":"2026-08-02T11:09:22.275369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15298/citation-record","integrity":"/paper/2412.15298/integrity","json":"/paper/2412.15298/citation-record.json","paper":"/paper/2412.15298"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-11T12:01:21.914803Z","title":"A compre- hensive overview of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.914803Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:d04e4fc0c2cee3adc53f9dcab700e8a45242f655495bf22ba62690e2283493be","observation_id":"33505e2b-e0f1-476b-9dd0-b5567c2d35b2","resolution":{"observed_at":"2026-08-11T12:01:21.914803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-11T12:01:21.922532Z","title":"A systematic survey of prompt engineering i n large lan- guage models: Techniques and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.922532Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:fd24172a881b02eb8281c70b22101144a17a8220f125f009eabb2d204ba3fef4","observation_id":"5df2753b-4781-433b-bffc-69ab70202a16","resolution":{"observed_at":"2026-08-11T12:01:21.922532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:01:22.422240Z","title":"Can an unsupervised clustering algorithm re produce a catego- rization system? In Proceedings of the 5th ACM International Conference on AI in Finance, pages 213–221, 2024","venue":null,"work_id":"9c7b7e18-41e3-4616-ac3b-074119093cf5","year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.933095Z"},"links":{"citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:1eff9ade47ceb8a8fb312158f0100a3f96cd9efd33c40005c77dbc12197d5d45","observation_id":"099164e1-a8bd-457d-8a8a-807d7b4b7b82","resolution":{"observed_at":"2026-08-11T12:01:22.428379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:01:22.400071Z","title":"Human-calibrate d automated testing and validation of generative language models: An overview","venue":null,"work_id":"934d1d12-bb98-4a13-9eda-c9b30a181453","year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.943107Z"},"links":{"citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:d108e770c2450e64706dd12ea19851220318b7a760fbbd4a9d6c518a70aa7a69","observation_id":"1878ef86-c5fb-42e5-88c1-8fdeeba3d7e1","resolution":{"observed_at":"2026-08-11T12:01:22.407632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:01:22.378809Z","title":"How to choose a t hreshold for an evaluation metric for large language models, 2024","venue":null,"work_id":"0f5d5884-cee4-4591-9bd5-24a3aaf11da9","year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.952896Z"},"links":{"citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:2e85db26cb08282f18948a6a27789d6c50d82bbb0cabb2d37c0d3fbd988de5f4","observation_id":"3ef7d701-b159-4d06-8586-750fabea96ea","resolution":{"observed_at":"2026-08-11T12:01:22.384672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-11T12:01:21.960419Z","title":"Dspy: Compiling declarative language m odel calls into self-improving pipelines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.960419Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:7bad08e25e8ea5772867cde094b1f77aaba3c0951b74aad0a9dfbe8badedbbfb","observation_id":"462d8068-cb13-4302-a522-efa972e1be84","resolution":{"observed_at":"2026-08-11T12:01:21.960419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-11T12:01:21.971357Z","title":"Parameter- eﬃcient ﬁne-tuning for large models: A comprehensive surve y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.971357Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:f1a0a9a51c93fcd2d2d5262330afc6fe0f709d530bd21a18584d0ecf27a08e75","observation_id":"704fc6ff-9df9-479d-a19c-df556e83c010","resolution":{"observed_at":"2026-08-11T12:01:21.971357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18703","last_updated":"2024-03-29T14:05:07Z","snapshot_observed_at":"2026-08-16T15:28:29.567892Z","submitted_at":"2023-05-30T03:00:30Z","title":"Domain Specialization as the Key to Make Large Language Models Disruptive: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18703","snapshot_observed_at":"2026-08-11T12:01:21.978252Z","title":"Domain specialization as the key to make large language models disr uptive: A compre- hensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.978252Z"},"links":{"cited_paper":"/paper/2305.18703","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:26f66fcc8c57731843820e813c04498b991ada1eb59f601aacbae2f209df15eb","observation_id":"5105474f-e8a6-483c-aee5-f50ed0c5cbf7","resolution":{"observed_at":"2026-08-11T12:01:21.978252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08488","last_updated":"2024-07-22T18:41:53Z","snapshot_observed_at":"2026-08-16T13:35:05.019172Z","submitted_at":"2024-07-11T13:22:17Z","title":"Lynx: An Open Source Hallucination Evaluation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08488","snapshot_observed_at":"2026-08-11T12:01:21.990131Z","title":"Lynx: An open source hallucination evaluatio n model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.990131Z"},"links":{"cited_paper":"/paper/2407.08488","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:7a07b6e5800c875dfbf6168d21f2d0a5bcbbcb1b0c52a554ea49c3d789a5c769","observation_id":"89de5ff8-6d67-42be-9eef-db2eb56a8c67","resolution":{"observed_at":"2026-08-11T12:01:21.990131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15708","last_updated":"2024-11-06T22:07:17Z","snapshot_observed_at":"2026-08-16T13:40:35.026676Z","submitted_at":"2024-06-22T02:07:10Z","title":"Teach Better or Show Smarter? On Instructions and Exemplars in Automatic Prompt Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15708","snapshot_observed_at":"2026-08-11T12:01:21.998399Z","title":"Teach better or show smarter? on instructions and exemplars in automatic prompt optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:21.998399Z"},"links":{"cited_paper":"/paper/2406.15708","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:9d86d8051dfbb65a18aff832553c2df7ea6d0ebeafa6dc230ac44faeb199da99","observation_id":"d3807932-4338-43f7-a734-d1abdf327ab2","resolution":{"observed_at":"2026-08-11T12:01:21.998399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:01:22.357823Z","title":"Dspy guardrails: Building safe ll m applications via self- reﬁning language model pipelines","venue":null,"work_id":"750b58c0-94cc-42b4-918d-9f283cd0e4bd","year":null},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:22.004134Z"},"links":{"citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:ba19f4f29e4c09347649041d2c2860f48210b0285c2f11a11a6f04ae7b442b39","observation_id":"56942437-dec7-4fe3-9b22-49bf6b255150","resolution":{"observed_at":"2026-08-11T12:01:22.364078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11695","last_updated":"2024-10-06T17:34:26Z","snapshot_observed_at":"2026-08-18T13:14:20.966153Z","submitted_at":"2024-06-17T16:12:03Z","title":"Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11695","snapshot_observed_at":"2026-08-11T12:01:22.009758Z","title":"Optimizing ins tructions and demonstrations for multi-stage language model programs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:22.009758Z"},"links":{"cited_paper":"/paper/2406.11695","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:71f9f81bdf09520d02ef3cdf284aeda92649a4d924c241771f2101e97d68523d","observation_id":"a28ef56c-fa48-4288-bacb-cd30988bde59","resolution":{"observed_at":"2026-08-11T12:01:22.009758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:01:22.335464Z","title":"Optuna: A next-generation hyperparameter optimiz ation framework","venue":null,"work_id":"572901df-bda8-4db7-9a31-9783738b9b6c","year":2019},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:22.019255Z"},"links":{"citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:b944e854fdf6ee2117ea9bf86beb69c53adc425b6edc3f0d6e560adc40d856cb","observation_id":"861fef18-8df1-45c1-bf8d-008d652bf422","resolution":{"observed_at":"2026-08-11T12:01:22.344131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-13T16:22:14.977210Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-11T12:01:22.025506Z","title":"Ra- gas: Automated evaluation of retrieval augmented generati on","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:22.025506Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:da15f8a0c850e9defd743f3e19b9f277bd4823d08d997a2ca93aea241185d1c6","observation_id":"c8302609-f110-4f57-8e79-b037138b71c1","resolution":{"observed_at":"2026-08-11T12:01:22.025506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:01:22.309381Z","title":"Fin e-tuning and prompt op- timization: Two great steps that work better together","venue":null,"work_id":"e67d9230-f12c-45d2-9c76-bd690155556b","year":2024},"citing_paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:01:22.032652Z"},"links":{"citing_paper":"/paper/2412.15298"},"observation_digest":"sha256:c023847686eb826742802f09bdb4f37d1e8feaf4ca475737667196a068e9267a","observation_id":"ae1b5330-cc1b-4245-88db-5d7c768385a0","resolution":{"observed_at":"2026-08-11T12:01:22.318380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.15298","last_updated":"2024-12-19T10:38:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T13:15:01.626991Z","submitted_at":"2024-12-19T10:38:46Z","title":"A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 4 inbound Pith citation observations for arXiv:2412.15298."}