{"as_of":"2026-08-12T04:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b98eb4696870c7271e82ce6ad49fd0be1c2968de14cd2494afeb55898bae22d0","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:48.666663Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00267/citation-record","integrity":"/paper/2506.00267/integrity","json":"/paper/2506.00267/citation-record.json","paper":"/paper/2506.00267"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:11:46.217794Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.217794Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:6b27a1c534ad3440199197a393d03bdeb40bb6ee5e31ffd1a7f12128ef8c5ee6","observation_id":"20d2571b-8058-4693-9321-3ff0d70de7f0","resolution":{"observed_at":"2026-08-07T12:11:46.217794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:11:46.264067Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.264067Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:0a9dce878adc1648cb1ec3c311af81be00bb6be78b69bce6e92f830e74fc6f60","observation_id":"a10d61bd-a6b4-4a14-93bd-853225f79f54","resolution":{"observed_at":"2026-08-07T12:11:46.264067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.340152Z","title":"Prompted llms as chatbot modules for long open-domain conversation,","venue":null,"work_id":"de2ece4b-684a-4866-8978-b915563ab190","year":2025},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.337326Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:44ce7b1ff6740ddec8494b8033c8f3f8261003b53ff58a447ba7f42858213975","observation_id":"a5aa4fb5-fcd4-47e0-b9a3-ca9464af18d7","resolution":{"observed_at":"2026-08-07T12:11:51.412743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.195041Z","title":"Soulchat: Improving llms’ empathy, listening, and comfort abilities through fine-tuning with multi-turn empathy conversations,","venue":null,"work_id":"910a2d6e-8000-41fe-a094-5b8b0e4f74b2","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.400788Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:9cd4ef8f9e3e2119ac0b5eda6e9775d453fccaf4279658e25ee00b086c4ce85e","observation_id":"68702bf0-4fe6-483d-8b5a-193ef597904d","resolution":{"observed_at":"2026-08-07T12:11:51.256684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13276","last_updated":"2024-09-23T22:54:05Z","snapshot_observed_at":"2026-08-08T09:32:41.730029Z","submitted_at":"2024-02-17T09:39:46Z","title":"When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection","version":2},"cited_work":{"arxiv_id":"2402.13276","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13276","snapshot_observed_at":"2026-08-07T12:11:49.215323Z","title":"When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection","venue":"eess.AS","work_id":"632ed622-e735-4e27-9c27-dc764376c0ae","year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.473021Z"},"links":{"cited_paper":"/paper/2402.13276","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:63ec29a19c527df729fc4520ca416ec9ef05512e1acf8f5a4e99c91b898b116b","observation_id":"01af7eaa-2dc5-47ca-9f3f-43e76e4097e7","resolution":{"observed_at":"2026-08-07T12:11:49.271166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T12:11:46.554818Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.554818Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:fdb66035a5de3d29a592833b7b6df62b4c4fd65e675097dfd2c776c2ba9bbe8a","observation_id":"8f8ffbc0-0994-4e5b-8f1d-117c528aabbc","resolution":{"observed_at":"2026-08-07T12:11:46.554818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T12:11:46.607323Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.607323Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:813b9161011883b3ceee1cf68052dc282f579fe07fb2d9425e6acea9db91b5d4","observation_id":"12be38bd-e5b4-4212-8fc6-b77c2f511ef0","resolution":{"observed_at":"2026-08-07T12:11:46.607323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T12:11:46.665649Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.665649Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:01ad89bb985f481d617c68d6bf14f98f48d07ba7436f6aa0446048d2a99c22b9","observation_id":"585a613a-78b9-4a1a-a340-eb7e9c2aa412","resolution":{"observed_at":"2026-08-07T12:11:46.665649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.738062Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.738062Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:80a1770f47cdf907ccc0eb9100273213ade10ccb6f4ca19b3cd555990944a289","observation_id":"b25e6881-bafd-4cab-9324-aa2c04069ef6","resolution":{"observed_at":"2026-08-07T12:11:46.738062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T12:11:46.821940Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.821940Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:13b52bd5233c5c6672f1ace09cc644af4ec4fba5f777319ffd3a7da639ee3d1f","observation_id":"b9409cea-226f-4a71-8934-78f224063019","resolution":{"observed_at":"2026-08-07T12:11:46.821940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.036278Z","title":"Switchboard: Telephone speech corpus for research and development,","venue":null,"work_id":"ea84a10c-252a-4f90-b194-b1c1636931fa","year":1992},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.894202Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:edb5b7eb62686f71282106519b1886adbca8b1c26ec71d8998e2ed4c80ea0871","observation_id":"def633c0-3a31-4809-b760-03aabdc36b7c","resolution":{"observed_at":"2026-08-07T12:11:51.104579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.962247Z","title":"Speechgpt: Empowering large language models with intrinsic cross- modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.962247Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:df30cf2d1522564fd6ee6284a8fb72a72992751b79a80b74758da7a7ed399bbe","observation_id":"ebbbb0b5-1a56-43d1-8e08-a6798db13e8f","resolution":{"observed_at":"2026-08-07T12:11:46.962247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.885363Z","title":"Generative spoken dialogue language modeling,","venue":null,"work_id":"8061ac90-7de1-402b-9e1f-35387c1f8d74","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.029630Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:c2200fd6636ea671ec9dcd1ac16d1fc45b8485ca2fb630a11b108b48086315d4","observation_id":"ee7048ed-e1d4-4086-98f8-c0cb7c5203c9","resolution":{"observed_at":"2026-08-07T12:11:50.946083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.095650Z","title":"Audi- olm: a language modeling approach to audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.095650Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:708bd2493bd5a12ec5659d91121b85ed4f2c57764a5199ced7c0c5f1b4b82e74","observation_id":"b0be04b9-5e03-4012-bf34-8f2746fd085a","resolution":{"observed_at":"2026-08-07T12:11:47.095650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.733218Z","title":"On gener- ative spoken language modeling from raw audio,","venue":null,"work_id":"37eab5b3-df44-4d69-a345-44fd7dca2810","year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.191571Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:1605dc24648db4f2b8db79c81b6b4ff4c343d5a23e8769bbd39f21e3ca5f0e84","observation_id":"6a76a570-96a6-487f-bebe-f838a94c974f","resolution":{"observed_at":"2026-08-07T12:11:50.794228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T12:11:47.225110Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.225110Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:f88c0e81b1f66533a17d587fcb09e767d991571ed3fc518a08c6ac3af29927fd","observation_id":"98b52e29-d426-4844-84cf-f880bbf562d9","resolution":{"observed_at":"2026-08-07T12:11:47.225110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.545857Z","title":"Callhome american english transcripts,","venue":null,"work_id":"808ce7ac-fce4-4cff-8ca0-d207f9ef5683","year":1997},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.243341Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:581a73e4f1a85b2780949e13d29dcf4134f9a8e28224fd6fc601659eb26cb7df","observation_id":"1c4e6eae-9825-44c4-9fa3-70505062d41b","resolution":{"observed_at":"2026-08-07T12:11:50.639637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.392902Z","title":"Santa barbara corpus of spoken american english,","venue":null,"work_id":"e3ece995-a442-451c-89b7-feb9df17c73f","year":2000},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.322984Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:4fe985b56abd2b2f59b939a2c0db4fd88fb352c1af3f80057ae30a88284c6d4e","observation_id":"21adb551-327c-41e2-8348-237c749781a7","resolution":{"observed_at":"2026-08-07T12:11:50.464850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.177213Z","title":"The hcrc map task corpus,","venue":null,"work_id":"1c7e46c5-410b-4def-93cd-3c8424763f87","year":1991},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.375416Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:4ddbbb7b7c20d136276a495dabaa6f30b2bc1a5e006326975e235759ede2b580","observation_id":"f58fb5a0-5858-49e1-8d2f-4cc00fd0c9fe","resolution":{"observed_at":"2026-08-07T12:11:50.263251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.037035Z","title":"The casual conversations v2 dataset,","venue":null,"work_id":"782e2fa4-36cc-4e9e-b417-98b3ed86556e","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.439037Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:f5fbc6db5b8ef33779ba9c69cc3a34da4965564447118da47c7fd881c500a019","observation_id":"eac548f5-d474-48af-8544-dd4a6551dcd3","resolution":{"observed_at":"2026-08-07T12:11:50.101839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.887413Z","title":"Scalable spontaneous speech dataset (SSSD): Crowdsourcing data collection to promote dialogue research,","venue":null,"work_id":"c2755e18-0ed6-44d7-bcb9-a58028c01f52","year":2025},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.530317Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:999c73b5cb4afff99119b0a1d1eb2b32c2f0d27f927a445108785456164671d0","observation_id":"a4d735f0-0d94-4c9b-b4b3-7b003aef0fac","resolution":{"observed_at":"2026-08-07T12:11:49.961062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.595510Z","title":"Silero models: pre-trained enterprise-grade stt / tts models and benchmarks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.595510Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:b77a5b8c26333e3de1a378ede540c56d32857697cff1ff1b6e6ee9673389edf0","observation_id":"93663259-1ebd-45fb-abfb-c9c63adfee40","resolution":{"observed_at":"2026-08-07T12:11:47.595510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T12:11:47.662234Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.662234Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:a552c95a99224cd02fe5ebde49de1582bef1d3ab380804150d47f7abbd67940c","observation_id":"fe169053-4210-4de0-8198-e5079bc077c8","resolution":{"observed_at":"2026-08-07T12:11:47.662234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.719498Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":"25d49d9d-fd7e-4719-bfaa-7f1b827d8438","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.716069Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:5faa8e4c234f93c564fe3d5d5990aaa0915142c7410e368d669722f22bb9d9f2","observation_id":"c6d6d965-b0d1-4d6d-a4aa-b65e52633e82","resolution":{"observed_at":"2026-08-07T12:11:49.803665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T12:11:47.792349Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.792349Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:b15e3873ae260c846ab105a5589bcb4d1d68592fbfc2d7a495f97cb75c4bd8c0","observation_id":"f5e0fc51-7c8e-4be7-92e2-c25b8c34c624","resolution":{"observed_at":"2026-08-07T12:11:47.792349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-07T05:13:16.889179Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-07T12:11:47.894977Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.894977Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:534d4eab25d36a076167f9884e817abb033640266e9258b31791eaac4efa2415","observation_id":"2a408a6f-7572-4d92-9c5c-cfc9a5a95e59","resolution":{"observed_at":"2026-08-07T12:11:47.894977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.584769Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe,","venue":null,"work_id":"46144549-6a24-4cb7-a126-feb2dff4af02","year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:47.969722Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:4329755d03889652501f9395c8ce1eccc964caa18171ebbf07d886f1593f6614","observation_id":"f8027b9e-d990-41c2-9b85-4cd0b71ccdc4","resolution":{"observed_at":"2026-08-07T12:11:49.643117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.053460Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.053460Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:a37904647e710625bf7cd843254a69baea803d951eb77b900791def51cf77e6b","observation_id":"dd6ac9b8-915a-453e-a378-98b7b56aca07","resolution":{"observed_at":"2026-08-07T12:11:48.053460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:49.411743Z","title":"End-to-End Neural Speaker Diarization with Permutation-free Objec- tives,","venue":null,"work_id":"4978aff6-4f18-41c4-9236-fe50bfb7af47","year":2019},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.390178Z"},"links":{"citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:9bd8c50652d00a269aa0c072dcc1e86e6b6e2ca8ff06fe8649146005121c4829","observation_id":"93064c8b-ec03-4c01-b10b-2f179de41d11","resolution":{"observed_at":"2026-08-07T12:11:49.495203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04410","last_updated":"2021-10-08T23:49:42Z","snapshot_observed_at":"2026-08-06T03:08:15.868993Z","submitted_at":"2021-10-08T23:49:42Z","title":"TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04410","snapshot_observed_at":"2026-08-07T12:11:48.497846Z","title":"Titanet: Neural model for speaker representation with 1d depth-wise separable convolutions and global context,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.497846Z"},"links":{"cited_paper":"/paper/2110.04410","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:55f68b02c650658e3a7de66547176b4f2b85c1e2f5fe2e2cc87a58045fb7e979","observation_id":"4d4c8745-b6ff-4949-98cc-6fd0a86d2b12","resolution":{"observed_at":"2026-08-07T12:11:48.497846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13886","last_updated":"2021-02-11T19:53:58Z","snapshot_observed_at":"2026-08-05T16:46:31.718115Z","submitted_at":"2020-10-26T20:26:05Z","title":"MarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection","version":2},"cited_work":{"arxiv_id":"2010.13886","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.13886","snapshot_observed_at":"2026-08-07T12:11:48.868568Z","title":"MarbleNet: Deep 1D Time-Channel Separable Convolutional Neural Network for Voice Activity Detection","venue":"eess.AS","work_id":"a16915eb-fa34-4d57-9bfe-d9de64e2b1d1","year":2020},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.666663Z"},"links":{"cited_paper":"/paper/2010.13886","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:20f1d5afe246b412de7d2d1fd8bd83e452abadd3852ac524c514ef57084db6cb","observation_id":"b51f5b80-4fd2-4e5b-aff6-46b514b89da9","resolution":{"observed_at":"2026-08-07T12:11:49.008646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-07T12:11:48.308009Z","title":"Available: http://arxiv.org/abs/1909.09577","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:48.308009Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:74dc924c851860d5253bb54bb217629e75547472a65396cd2026eb48389c3053","observation_id":"e119618a-71ac-450a-aeb4-c03b60e10a78","resolution":{"observed_at":"2026-08-07T12:11:48.308009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2506.00267."}