{"as_of":"2026-08-10T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3ef415e8ee0a58ad471908e61fcdd78e248323bf725ee0dde309a75f7be3e3a","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:41:39.242748Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:41:39.242748Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T21:36:15.426863Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"cited_work":{"arxiv_id":"2606.01134","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01134","snapshot_observed_at":"2026-07-01T21:36:15.426863Z","title":"Context-aware child-directed speech detection from long-form recordings","venue":"eess.AS","work_id":"2f64c48e-eefc-4ecd-b381-7e6bf4fb61aa","year":2026},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"cited_paper":"/paper/2606.01134","citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:5ffd0fc464e5d3d055fe7517ef0de39594242f6abb826891eaaad91cc7e1f4c6","observation_id":"febb9534-2a45-4e9b-8864-99afeae7f658","resolution":{"observed_at":"2026-07-01T21:36:15.428424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.01134/citation-record","integrity":"/paper/2606.01134/integrity","json":"/paper/2606.01134/citation-record.json","paper":"/paper/2606.01134"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"cited_work":{"arxiv_id":"2606.01134","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01134","snapshot_observed_at":"2026-07-01T21:36:15.426863Z","title":"Context-aware child-directed speech detection from long-form recordings","venue":"eess.AS","work_id":"2f64c48e-eefc-4ecd-b381-7e6bf4fb61aa","year":2026},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"cited_paper":"/paper/2606.01134","citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:5ffd0fc464e5d3d055fe7517ef0de39594242f6abb826891eaaad91cc7e1f4c6","observation_id":"febb9534-2a45-4e9b-8864-99afeae7f658","resolution":{"observed_at":"2026-07-01T21:36:15.428424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"We then formal- ize the addressee classification problem before introducing the self-supervised models we considered, and the context-aware fine-tuning strategy we implemented","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:4fc50f2775e6b4604995960e72ad69f37c7d81cc0aec8aec2766312f9dbeef68","observation_id":"07f63665-9d3e-4cb9-9775-3f77fa426a1c","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Effect of self-supervised models We begin by addressing our first question, comparing multiple self-supervised models fine-tuned on our addressee classifica- tion task (Table 2)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:aa14cdbce83c84a24f9a7007bfa2a0a2cda0d9f973972f3ab85c4784ffe9ca1d","observation_id":"44dead31-9160-4ad6-93c0-d48c8f9240c8","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:c79054654d2eb0db8c86c0c411d144d264f9c3af5feb6dcc95ce26f960e39a8d","observation_id":"b3a7f5c6-2b02-49ab-a20b-0b0425e90411","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"TC was funded by an ERC grant (InfantSimu- lator, 101142705); AC, KS and TK were funded by an ERC grant (ExELang, 101001095)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:e03f902962e01c116afad1ea9585857081ce57e519b2a71175b92119f628bb00","observation_id":"e8d6bca9-bb05-44a7-a456-4781ace0cd5e","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"The inevitability of child directed speech,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:c63a7434c9229774c915e6c7da3672ede8d91782af571fe8657a38e4162828fa","observation_id":"32263595-8357-4457-835e-c96737be0463","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Acoustic-lexical characteristics of child-directed speech between 7 and 24 months and their impact on toddlers’ phonological processing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:e78944535afa7e417c5b5649bae718c626c170d0d33576a7c54cba060f4dcc75","observation_id":"9227d3d7-45c3-4a9b-b9f7-b89344d597aa","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Does child-directed speech facilitate language development in all domains? a study space analysis of the existing evidence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:3a396f31981b7af5eb32528eb3819223c06bf1752d640740e2f688b9006f646a","observation_id":"9ac0fe0b-fa14-4215-9385-52fc85a8f9ab","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Word segmentation cues in German child-directed speech: A corpus analysis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:aa9f8794795a49d94ae6ff0d0d0bb22af35f7ff5e3eb83fec0978d672b51f8e8","observation_id":"aec1e421-ffe7-4027-8a4d-4dfb037a78e6","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Quantifying sources of variability in infancy re- search using the infant-directed-speech preference,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:e15ed3a4a604285f6021a74d0ffd6502dc0662366cd187f3bf1bf4a4aa95aee8","observation_id":"e26a5b49-bd67-42d6-afd9-069ac381fdaa","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Statistical speech seg- mentation and word learning in parallel: Scaffolding from child- directed speech,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:d77fcc63ee3d70f88dbbf2e820a896149bdab8fd2c9d5c0546d05c093d8166cd","observation_id":"fa03fadc-11eb-4831-a1c9-4046df309b1b","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Language learning, socioeco- nomic status, and child-directed speech,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:0053b62e3c18f443e41d2582470b08a36e603755417b753c9302c07151555cbe","observation_id":"ec413b8f-30e1-421d-9f4a-41b394ac1652","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"The INTERSPEECH 2017 Computa- tional Paralinguistics Challenge: Addressee, Cold & Snoring,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:7621a87c55111998017f5e19a74d46938b0c7f9f23e7eace64350e24a05f9a9b","observation_id":"79a582db-6eea-47e4-8ffb-66acbd7265eb","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"DNN- Based Feature Extraction and Classifier Combination for Child- Directed Speech, Cold and Snoring Identification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:899e3ed915409e3b259b235d534da939e6089ef1df2c7d39fa9d5ac6101e593d","observation_id":"38ec42a7-6670-486e-a0f2-8edc96a6ead2","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Introducing Weighted Kernel Clas- sifiers for Handling Imbalanced Paralinguistic Corpora: Snoring, Addressee and Cold,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:5625fe27ac8e40ef4da2301ecf47ea2f21a8a3dabe61f1bd4e480a0abae98019","observation_id":"c3e19db9-e1ac-41a7-bd8a-747c8af586fe","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"An automated classifier for child-directed speech from lena record- ings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:16068d627dbda777caf59aaef15f73c4ea5d073e7f60600479e4349a23c27bae","observation_id":"98b179c1-9dfc-4aa3-8532-54566dbe614c","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Hearttoheart: The arts of infant versus adult-directed speech classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:9da609128f599b0c1066228bb3bbd04fa06e96459d584060a48f10c6241919a5","observation_id":"a78df8a6-2d29-405d-bc33-c39c99e543e2","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"The weirdest people in the world?","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:6bc8b753b23bec48ab50a3c91faab40254dc288b293fc79e1d363c1c39b5ccb6","observation_id":"b7012c33-43fc-4fe6-b93f-7c205de32ae2","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Child- directed speech is infrequent in a forager-farmer population: A time allocation study,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:4cbce751a5ced15cf18ee859623cc9876102cf0d5890ac3ed8735f2046da9700","observation_id":"be19503f-e6b6-4479-a755-ccde06710e8c","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Babyhubert: Multilingual self-supervised learning for segmenting speakers in child-centered long-form recordings,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:f78b8a8f5dbb9cf8a6c1a4202cc3a9ad8d1488ba1fcfea25dbe924e97198164e","observation_id":"d7cc95f3-e8be-4843-bf38-6f20f52a700c","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15001","last_updated":"2026-06-29T13:06:46Z","snapshot_observed_at":"2026-08-05T23:26:08.097511Z","submitted_at":"2025-09-18T14:34:17Z","title":"BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings","version":3},"cited_work":{"arxiv_id":"2509.15001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15001","snapshot_observed_at":"2026-07-01T21:36:15.429731Z","title":"Babyhubert: Multilingual self-supervised learning for segmenting speakers in child-centered long-form recordings","venue":"eess.AS","work_id":"4b68d120-3d68-453c-9053-68524cb61b19","year":2025},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"cited_paper":"/paper/2509.15001","citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:e57e7fcb9488e681c63a34f6468fc401467a47b3d3cf5de0e4b10eb3f6f597cf","observation_id":"32db9e29-730a-4637-ade3-0a6bc1b8ff2a","resolution":{"observed_at":"2026-07-01T21:36:15.431349Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Homebank: An online repository of daylong child-centered audio recordings,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:b1bc44abe580b8431a17c6df44ccac5c33220fdf3860417ef96cb69515005061","observation_id":"c0685071-39c7-4854-9905-a939e208046b","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Ticuna (tca) language documentation: A guide to ma- terials in the california language archive,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:1b3b46e03856d09eabcc323906351f9e15bf309ea913abaddf36ac402404d968","observation_id":"622f712b-d376-4c53-bb13-a968c4a03827","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"MacWhinney,The CHILDES project, 3rd ed","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:fa2d6f5cd769773133514fd076335a38c1265e0cb2b01df9eb94852b472464dd","observation_id":"487ac203-de7a-4f5f-8f7d-746ed982f4e6","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Lyon HomeBank Corpus,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:299ee5faa8b15001fb819e3e5828b8e041ebfe563b6de2752a6b61bfbbfd4941","observation_id":"b3108d51-1093-4a93-846a-38dce1cf4d45","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"VanDam Cougar HomeBank Corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:fc3b10c7958ea118631cbd576428faacf25fc9e711cbdcf7a65260c6806e5c54","observation_id":"c171c5cc-fb4e-411a-bc12-ac08b50f44ff","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Bergelson Seedlings HomeBank Corpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:e0b23132c5694eb0d9a9fdfb7497859b452f2a4fc2a9b1fb12cc50a1441315ac","observation_id":"d082dc1d-5fa1-482c-a0cf-da403e1b33fc","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Long-form recordings from children in rossel island","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:540d8d298feb3c51a44f9225950097387b19bcc3c5fe94eb382ace5c4f5c93ae","observation_id":"88758381-ba70-4a42-93f0-41048606d706","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"The language 0-5 project,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:bf62ffc6bb0dd115b725cf2a05b1d3ab02d7669d857c07d614e402beb92948f2","observation_id":"6ac20bfa-06e5-44a7-b2cd-d6e9a3c1f507","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"San Joaquin Valley HomeBank Corpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:517a61a76998e29d73771f66fa99745e7197fa00fefeba80d01d43c29ac933ba","observation_id":"9a9e305e-16f5-40f4-b670-4375ba18c052","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Acoustical cues and grammatical units in speech to two preverbal infants,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:d796f1300a9bd37eb425128436999185c3713f4991502ea5229782d309b528da","observation_id":"a4d2f667-62d0-41ff-af2b-39217c2c8509","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Characteriza- tion of children’s verbal input in a forager-farmer population us- ing long-form audio recordings and diverse input definitions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:6173305fd32fa460001e84fe01cc8ee7ef890454657cbefff48b4b563404a15c","observation_id":"1c22fb6a-997d-4d73-94cc-6df782455848","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"PhonSES: A pilot study to measure socioeconomic status association with infants’ word and sound processing,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:978a1761528ab1e4acf10a5b274d5681ec6423e0aa9496b9e24ed8ef0613a395","observation_id":"b456d619-0a7b-4a54-9c5e-6a9e7b3e73ed","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Available: https://gin.g-node.org/LAAC-LSCP/ phonSES-public","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:6dcbd6ec2d75310ad5d13f2f37f8daae7f1593bed6c1dec5376e5da4b3d9d210","observation_id":"276f9b7b-1890-4576-9cf4-b47bd7b0762d","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Two-year-old chil- dren’s production of multiword utterances: A usage-based anal- ysis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:d50210d3e78a4d9932a1e5d6579b1d7a803a82ff139cb0fd70ac04f0afb4d3be","observation_id":"97cc7fed-2496-4c25-8d76-ad5e2bc4fd55","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"V ocal input and output among infants in a multilingual context: Evidence from long-form recordings in vanuatu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:3543276848d2fe6a3f3feeef9be1044facddd07b9f60f6cf8ec9e4092d9251ff","observation_id":"197f07df-a239-4f2e-b4ee-4fe93ce945e2","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Casillas Home- Bank Corpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:bca8f2a35c65390fc7244e72fc1dfb7b78c7348d4d1c189a9a18dd1a296c930d","observation_id":"adf696ff-1483-4bec-9eb6-4d5e1db3ae64","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Winnipeg HomeBank Corpus,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:97d71866238c1702ae63dcd227f703c0f93abad0cddc168d8e86a384d684ff1f","observation_id":"37f70158-d3a0-4764-849b-8ce590936c92","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Early language ex- perience in a tseltal mayan village,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:1b5a02111b99be5f018ff8544c7ac55252ecd60621ff627a9ec3622390fc7b38","observation_id":"2bf7fc64-2140-44db-8a60-5bc0ea1b0135","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Improving automatic speech recogni- tion performance for low-resource languages with self-supervised models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:ddac7e899d2482adad3d51125bfee71a6f1de7b2ef1338cf31335157b292641b","observation_id":"0afed4c2-a06e-48ce-b1d0-a63479da4950","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:c3b29283449d6aafcd06f8b4da39b042a690e6d455b4ea55a88db6ffe2044320","observation_id":"ebdef8e0-412f-4978-966c-f25c0eb5c80e","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:20b7638b3a9526d9eb359b8a2016854490dcccc21f6b5bf82e44954c536ce018","observation_id":"6159a4df-793d-494a-8ddf-ad627e4385a5","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:0e832857d2090193561b93aaf86e1dc474919cc2b28c127c6ac14983843aa4b9","observation_id":"bfcf258a-53ca-4dba-9a57-0ef5f6adf3c4","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:41e882f3e18a64159ff4287b1664b73f4718190008775d9c2d63672e45091bb5","observation_id":"797127ee-12da-44de-8f72-8e342d5b617d","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Unsupervised Cross-Lingual Representation Learning for Speech Recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:67b169689ee83f7869aa8a0f20b93216f44774dfe6de23d9af6abb816d016adc","observation_id":"fd521135-343a-4790-95b2-f36b9ea039bd","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Towards Ro- bust Family-Infant Audio Analysis Based on Unsupervised Pre- training of Wav2vec 2.0 on Large-Scale Unlabeled Family Au- dio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:6d7f9d6769f965f084ba935797fa974897f74866d51ae33e04f3f2b1164e550d","observation_id":"80afc339-6867-4bc8-a650-331e4cee2afd","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Context-aware transformer trans- ducer for speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:ed8823ae83696bf2845234a35ef91e6caa470c5caa7678adddf03626e21295a7","observation_id":"9b711b57-3ebe-4644-8443-780de71a21e5","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Dialoguernn: An attentive rnn for emotion de- tection in conversations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:a7bb9757377734363135a65f83940a607f45a7f201668ccffab5faee513432e8","observation_id":"13d066b0-dec5-4d3e-820e-a7761810ebee","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"Improv- ing speaker diarization for naturalistic child-adult conversational interactions using contextual information,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:6f56b701b105b36a5bf6acb76907a3a9d05e60aa9fb04f51917d46d814a2cd66","observation_id":"62b206cb-2b7a-4452-9780-ae8ac94b16de","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:41:39.242748Z","title":"An Open-Source V oice Type Classifier for Child-Centered Day- long Recordings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T16:41:39.242748Z"},"links":{"citing_paper":"/paper/2606.01134"},"observation_digest":"sha256:35bfa78edf84ef5a45f15e5f3a4481b632f54cf722223aa603e37b26698a8616","observation_id":"31b93db8-715a-45ce-aad1-925a247d316f","resolution":{"observed_at":"2026-06-28T16:41:39.242748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01134","last_updated":"2026-05-31T10:12:47Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T21:55:11.856032Z","submitted_at":"2026-05-31T10:12:47Z","title":"Context-aware child-directed speech detection from long-form recordings"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2606.01134."}