{"as_of":"2026-08-11T07:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca7bda1d62db53d2fd11ed90176e08c1a23ec22f7ca01e4bd38c9f2469955254","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T12:15:13.993477Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:43:31.569388Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15161","snapshot_observed_at":"2026-07-13T05:07:42.040673Z","title":"Rahmani, and Emine Yilmaz","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T05:07:42.040673Z"},"links":{"cited_paper":"/paper/2601.15161","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:eeb213d69f1adff57289f82b0e9fc5188a025554a31f82f1f26187a196ab3e28","observation_id":"ea558101-6e05-421a-9543-d2c65522bd06","resolution":{"observed_at":"2026-07-13T05:07:42.040673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15161","snapshot_observed_at":"2026-08-02T07:43:31.569388Z","title":"Rahmani, and Emine Yilmaz","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09142","last_updated":"2026-07-16T10:17:24Z","snapshot_observed_at":"2026-08-06T22:09:00.592774Z","submitted_at":"2026-07-10T06:52:05Z","title":"MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T07:43:31.569388Z"},"links":{"cited_paper":"/paper/2601.15161","citing_paper":"/paper/2607.09142"},"observation_digest":"sha256:1dfa03b9f1d0113ad103dd92676ae3c8cabbb05b9f4a89ff018723c152b64a6f","observation_id":"06ee9cf1-7695-493b-bb5d-11eacaead115","resolution":{"observed_at":"2026-08-02T07:43:31.569388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15161","snapshot_observed_at":"2026-07-14T06:30:16.612345Z","title":"Automated rubrics for reliable evaluation of medical dialogue systems.arXiv preprint arXiv:2601.15161, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11175","last_updated":"2026-07-13T07:16:50Z","snapshot_observed_at":"2026-07-16T23:19:14.481825Z","submitted_at":"2026-07-13T07:16:50Z","title":"The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T06:30:16.612345Z"},"links":{"cited_paper":"/paper/2601.15161","citing_paper":"/paper/2607.11175"},"observation_digest":"sha256:ea2547ad38aa90f24659a28c7cce00cc5338ab334c7cb302b4e9557df51dbdfd","observation_id":"cdc478ff-a4e1-4d1f-9cea-c22ec7c08386","resolution":{"observed_at":"2026-07-14T06:30:16.612345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.15161/citation-record","integrity":"/paper/2601.15161/integrity","json":"/paper/2601.15161/citation-record.json","paper":"/paper/2601.15161"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d6729640-33b1-42fb-9d1e-0a13d7e3df75","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:9973c2a26a65a57420df0607a606c786ffb6f4632b5cbf5ab6207b57c20fca28","observation_id":"39d257bb-81df-416b-94ef-67d884a0c02f","resolution":{"observed_at":"2026-05-16T12:22:52.942354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"decc3106-a4f4-4932-8faa-719c4ef31df9","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:cabcabb95284d13b471252c2f9b39acb6d1edd662e6e275f719906fba5f85cf5","observation_id":"56b171ef-e298-492d-a964-2b2f3dc1379f","resolution":{"observed_at":"2026-05-16T12:22:52.946776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4743015b-4b41-4480-95cd-4207b0db246c","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:8f3be1f45db0377a2fa6f4cc5ddb6315f7da1cb81a7d9ea1f1b83efd58e3a8a4","observation_id":"95355d56-5d96-42e0-8ebe-de28af1e90cc","resolution":{"observed_at":"2026-05-16T12:22:52.960908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e21bff1f-5723-463c-8c17-f3b86df9fd2f","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:ea502889842fa2cd2845a8377f4a3b6f44b3bc9d3d40b809af1c47089de74028","observation_id":"25d2c07f-87a8-4726-bd3e-fc1c25c316d5","resolution":{"observed_at":"2026-05-16T12:22:52.944421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"intent”: “string","venue":null,"work_id":"ab47405d-0aa5-4db4-b1a3-019335d06cc3","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:d1e6bdbe57f33e357fb2eb69a9a188acd5b568d49d3b3a1d677b0d9a4318a53a","observation_id":"f475507e-6ef5-4805-aa57-c1a9f179d5a9","resolution":{"observed_at":"2026-05-16T12:22:52.993694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ee8fbaa-e1e9-47cd-a19e-96957ea6eff4","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:71f3c2d33af9c690a3e546171fdef1c5517eb743f503ea2620d860ae342f6623","observation_id":"eb2be8f7-f2e1-4e46-93a5-4a8b2051f96b","resolution":{"observed_at":"2026-05-16T12:22:52.976031Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"synthesis","venue":null,"work_id":"425795b0-1e04-44e6-9835-fd119a709656","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:baee8454da9da32e6aa4f51427d48c4ffaffab0bbba2a47047a5c6e3aaf701f7","observation_id":"9f0d9769-2233-47e0-a617-23e0a76486e2","resolution":{"observed_at":"2026-05-16T12:22:52.981952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"evidence_sources","venue":null,"work_id":"c1dce27e-23b3-4d67-8b70-9589ff0e9bee","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:267e2069cff55e7b3ab5ff81b548275d1235564f79de1046263023353e8bf573","observation_id":"1f4f3e0a-c675-4301-99c7-670efa91b62e","resolution":{"observed_at":"2026-05-16T12:22:52.972046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"synthesis","venue":null,"work_id":"fa99a194-b799-4efe-9499-206db47be23b","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:5760c6fb9028557afe8f293a6a7717b628b443667a7aef754180adebf661c315","observation_id":"3dd3d269-dc01-43d0-a80c-9ad5c764d190","resolution":{"observed_at":"2026-05-16T12:22:52.991283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ATOMIC FACT","venue":null,"work_id":"97cc27c3-b815-4fef-90ba-6a216a51358f","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:43831d02b2cd96cb7dd4a182179b25d5316dae010f18531a7bc2bf44bcea7c21","observation_id":"b5a6994c-e9e9-47c3-b3b0-050f9749e32b","resolution":{"observed_at":"2026-05-16T12:22:52.964838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4b6dd7d0-36b9-4891-8703-190151bfcf24","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:fe71b1193e8d4544c9c6b83a7fbdf117ab0643a08ffcc829f8a6123741a5bc80","observation_id":"99b42564-0e1f-4d2c-ab71-9eb878b02bed","resolution":{"observed_at":"2026-05-16T12:22:52.977872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4391bb1b-75a1-4866-af65-271a787871cf","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:c0ec613a211b57547756c3e15299864a813968eac27e5fe2a1679d51d8fbdc4a","observation_id":"9f14dd4d-2a08-4e7d-bad4-a31ce6355970","resolution":{"observed_at":"2026-05-16T12:22:52.968405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If X, then Y","venue":null,"work_id":"b5ef461d-12ea-4e3f-92a8-0f26f9231e20","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:d787fcdb1392cf10cabb54910768b116e45314a8810fdf0b4c45f67c7e74cf01","observation_id":"277c1c4a-fe8c-4b0a-82db-25c72a232a94","resolution":{"observed_at":"2026-05-16T12:22:52.970196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c512336d-82d4-4785-9cc9-b6ab85a0a9f0","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:a396629aa7e072487ac223a56e8d77e9ca7b445f1b8672686146215ad3665f79","observation_id":"2c74476d-9bd5-4873-afdc-96b6979682c3","resolution":{"observed_at":"2026-05-16T12:22:52.973977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f8169d53-e0d5-4a5e-a6cf-aa2711be5a85","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:f526893841222aa3267b879b7b93408c7a39bad55722e43d80dbb224e8356b5d","observation_id":"9406fa61-1684-465b-9b92-e22728dad813","resolution":{"observed_at":"2026-05-16T12:22:52.959052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1f134a5-4ac4-4414-8e10-8deca87cf448","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:f04de9574a67f336bd26b75d85d31d72b7cf6f461c4b82d75f6630c3edb6139f","observation_id":"bd5e3008-fc7b-4137-8ee1-14e606db5eb0","resolution":{"observed_at":"2026-05-16T12:22:52.988701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"relevant_positive_facts","venue":null,"work_id":"d6cedb1b-651f-4a7f-b373-79492ce1994d","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:7a82f2bb1bdbf9ef436ef275c2fcd54329dad65296c2b55e29f869702f7279db","observation_id":"9bfa97e8-0fae-44a4-8efc-c2bf201d5cec","resolution":{"observed_at":"2026-05-16T12:22:52.962875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6b98ae4-2462-4cfe-b36b-a32e06d04035","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:47c2cd68d31a288a274bf64063e5b9ece0ba0573b4a75a6558d4ccd885c4b1b7","observation_id":"d35bb255-707d-4bff-8a64-44ea006b90a2","resolution":{"observed_at":"2026-05-16T12:22:52.983705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4326f4ef-7cc6-4294-83fd-0c86ace55854","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:d9cb02b43e0d19e2afe374347cb1a2b69e448fe5e03865ec3d54083c52723eca","observation_id":"a0261109-d8c2-454a-8384-bce4cd266a0b","resolution":{"observed_at":"2026-05-16T12:22:52.985788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"user_persona","venue":null,"work_id":"0b7a8cc8-9200-4b5c-b8eb-5f90c01b0511","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:ceaf03d00c860e7b142a3dc3a269fdc7dc548088558ee496d6b77c78b4fa3d7b","observation_id":"61b62f8e-ee1f-4d91-8de3-3268d4a08b5b","resolution":{"observed_at":"2026-05-16T12:22:52.966654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c02460b6-083e-45ec-9cd4-58a6ee41eb73","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:54b0a10749c0189676b954ee825b6a663ab3d7aa5171a286727d0d763f983af7","observation_id":"53b77851-8acc-4076-9554-c1107a31d4c8","resolution":{"observed_at":"2026-05-16T12:22:52.953135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CONSOLIDATION STRATEGY (Cluster & Enumerate): – Group related medical concepts into coherent evaluation criteria","venue":null,"work_id":"c1c55440-b1d4-485b-820f-dc4d2710b8a9","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:8b8d0766495be7da94fb7c929c8d8e2df241facdbd95832e8b26c697d2312492","observation_id":"31c2f9c4-a6ff-4270-b327-abe713b03458","resolution":{"observed_at":"2026-05-16T12:22:52.979957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"– High magnitude (−10to−8or8to10): safety-critical or accuracy-critical items","venue":null,"work_id":"67a2c4c7-4ddc-4fc2-8dbf-5efb76ba8313","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:927b8d9f5af3f8ca483322b2bdba2854ac90d7da03593c3e3cf547da76323524","observation_id":"f1ea6e7e-e1c0-452a-8396-723cfda75559","resolution":{"observed_at":"2026-05-16T12:22:52.948959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Correctly identifies the recommended dosage of 500 mg","venue":null,"work_id":"fd725c4b-377f-44b2-b972-681c2757ef44","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:15c91584f7e5e5186e0118a4a7a71e5a3b113241e9289576d69f1f82c59b06e0","observation_id":"2a2bd9ad-e63c-4ee9-8f11-a2d75c099a7a","resolution":{"observed_at":"2026-05-16T12:22:52.951099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{user_query}","venue":null,"work_id":"3a03ba5e-a443-451b-949e-e0f75af0cec1","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:9a30c43a78a35079f19e1777f0e0eb42f69c8bdaaad89e514e788a9b977cdb70","observation_id":"9523bd3c-d13b-4d81-9ec7-9de4852d60ec","resolution":{"observed_at":"2026-05-16T12:22:52.957248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2f2d4107-58ca-4892-aaa5-f8493251901a","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:238054e911abcb135ddc8d40b651bf9aa2d0f65fa7b91afbbe269fb03ac39369","observation_id":"de94ad6b-a929-4239-ab48-2add2f806f33","resolution":{"observed_at":"2026-05-16T12:22:52.995868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"rubrics”: [ { “criterion","venue":null,"work_id":"00fc4879-3fbe-4cc1-9feb-48f248a0b59f","year":null},"citing_paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:15:13.993477Z"},"links":{"citing_paper":"/paper/2601.15161"},"observation_digest":"sha256:3fc40ba7f9643710f9184d09bace8b727fa9b68bf94051fc2904e8555e8414dd","observation_id":"978af91c-f3cc-46d4-a524-d1453ff2aed9","resolution":{"observed_at":"2026-05-16T12:22:52.955243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.15161","last_updated":"2026-05-13T10:14:37Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T00:43:40.453288Z","submitted_at":"2026-01-21T16:40:41Z","title":"Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 3 inbound Pith citation observations for arXiv:2601.15161."}