{"as_of":"2026-08-09T23:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c601ee3bb3738782179410fd13851a29ac04a99617c817926e1e5521a81fc943","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:11:03.723969Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:11:03.723969Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03201","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"arXiv:2607.03201v1 [eess.AS] 3 Jul 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2607.03201","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:1ebf240f9bee71b8acc811cd7690f22296b69e503c4c4ef0705b675594e3c4ce","observation_id":"493c40f2-70b9-4090-a8da-2532555204c5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03201/citation-record","integrity":"/paper/2607.03201/integrity","json":"/paper/2607.03201/citation-record.json","paper":"/paper/2607.03201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"However, three problems have prevented LFR corpora from be- ing fully leveraged for speech tool development and evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d301d446d463fa21f1c4db548fee093aa8d97edd61e644c69db0deacaff5ebbf","observation_id":"6c23bb2c-e763-4bc8-9aa0-9fc481a64fb8","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:a8d21496f2866bc91348afdd3d9a7101295eb6dc08507bf1a69f20f2344728ed","observation_id":"cea2fade-2334-4ecc-aebf-601ad16d9287","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03201","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"arXiv:2607.03201v1 [eess.AS] 3 Jul 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2607.03201","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:1ebf240f9bee71b8acc811cd7690f22296b69e503c4c4ef0705b675594e3c4ce","observation_id":"493c40f2-70b9-4090-a8da-2532555204c5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:711e1c3380f6f8a5854a3a134368eba806be9b8b5311e883eab36ee6c77d82ce","observation_id":"7221d4a9-815c-4a81-9c12-c81d0ab33a25","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:3808af5a38b963cae9761e4480fedda8bd3f6ad579a3f0f65836dae246c93879","observation_id":"ba52b736-c9c3-43c7-8b2e-ac3f92d90bf1","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"friend” or “cousin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e66b6b389da57278d183888830a94430e9f7ad1de6b890f307c07400d07cf736","observation_id":"efa2ac19-1132-440d-a2c3-16688456a203","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Without systematic governance, the collection risks either over-restriction, which limits scientific progress, or under-restriction, which compromises participant privacy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:c78064e3b78b4c0c3acdd6bdd84a1cda9d50d6ae7b3a0100ff2302d4bd639e36","observation_id":"53def726-fe24-45c9-aca2-407fb833f018","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Retraining on public data alone yields substantially lower performance than the state of the art (44.4% vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:5dcebdba0033510a573597cd7f08ac5a9a2cd168db29889613e9c05845abbc78","observation_id":"023928f3-e9bf-44d3-9cc1-76faf17b6f9d","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"KS, LB, TK, AB, LP, ST, and AC were supported in part by the J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8f05dcadf0ac2338fd4dbde0a11ac594837f361485a76786136d4950e0af0bfe","observation_id":"73d2c11a-8ed5-4c08-990a-bd4f5671d14e","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"All scientific content, methodology, ex- periments, analyses, and conclusions were conceived, verified, and approved by the authors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2e72a70a3af8cb3fe05596f3b4fe945b1206ccbe3eac4c23330a06b35fa54a22","observation_id":"a4a0ee3c-a520-4b88-a513-2badf2d64077","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Daylong egocentric recordings in small-and large-scale language communities: A practical intro- duction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:9c9518f0c750002b0b4698eb2567e7b68ebbc6aea52d0d905cc621ed3a6560d7","observation_id":"87c4a761-dbc4-47f6-8d3b-7af20da22c16","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Longform recordings of everyday life: Ethics for best practices,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e7f06a073b9df158c3f5721701a3a9146170d67e92c82b8aafc2d8ce2b98c244","observation_id":"4fbfba34-e7c4-4fdd-a735-392ecbb44172","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Fifteen Years of Child-Centered Long-Form Recordings: Promises, Resources, and Remaining Challenges to Validity,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:03317db5b5a14713ebcfcf94bd7a69f2920e14dc85188933bf45ec8a48648ae8","observation_id":"0d844b1f-673f-4fe5-b402-34fd9f58d374","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1055/s-0036-1580745","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Homebank: An online repository of daylong child-centered audio recordings,","venue":"Seminars in Speech and Language","work_id":"040eb749-07e5-4863-af36-40662adc8032","year":2016},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:4a87839c33c6775fff31bec71940a2f79b1f7ad43105d71627e60baa1be51a26","observation_id":"0a970361-c390-4330-85e5-a5872203716d","resolution":{"observed_at":"2026-07-12T04:18:29.403539Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:20.365215+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:20.365215+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Practical solu- tions for sharing data and materials from psychological research,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:4f80d3bb3f325be323865e222ce07dd784a70fee608d7fed02a04115a782ea45","observation_id":"2f9904eb-976b-4c71-929f-88ea95341991","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The LENA natural language study,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:34f33082a9284a33718ac6c4be548104a71d78a7e44009c68d991eaac0b212f2","observation_id":"aa075210-7c92-484a-8fdd-df1c70a99f35","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Babyhubert: Multilingual self-supervised learning for segmenting speakers in child-centered long-form recordings,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8a78b48bcbebc6eff34eb2a7cc0c4990e67f564d5e5b6fcb5ac7bb11bca8f08f","observation_id":"d5fdebf4-c678-4a73-ac49-2d939638aea0","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15001","last_updated":"2026-06-29T13:06:46Z","snapshot_observed_at":"2026-08-05T23:26:08.097511Z","submitted_at":"2025-09-18T14:34:17Z","title":"BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.15001","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: https://arxiv.org/abs/2509.15001","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2509.15001","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:9bbd09b715ce3bce304e9e0c51031487223a65aacb359539ff2c4b0aa8d940e9","observation_id":"888dcef7-0ea1-4f2f-afb2-793b987d7be0","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"A new workflow for semi-automatized annotations: Tests with long-form naturalis- tic recordings of childrens language environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e6999421bc13a8b99938c27ad5c389a7383017d1ba65af63b7aa6734eba91738","observation_id":"9eb49bb0-cd8c-414c-bf88-14c5f659c796","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Managing, storing, and sharing long-form recordings and their annotations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:bc037663b419286e57591ce74fb92ca19d976a79fcb79ba60a60ef42d2e75031","observation_id":"2fa911fb-0aa5-458e-a8b5-8527efb289ee","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"From childes to talkbank,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7394386a5033317a3c6484b06ee24b155da5117d84716f12b1103ec6eb5b6118","observation_id":"8e2c4aab-4605-4123-baf5-0116ec56dcb9","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Ticuna (tca) language documentation: A guide to ma- terials in the california language archive,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:a9c515d12582d807904a365bb432d0a775e88529cb9fd8d3df74b3ba7a74a3a8","observation_id":"d8720636-63d3-4388-a7bc-9956942dff2a","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Demographic biases in naturalistic language recordings in the childes database,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2b30788f81eaf9d4288dc9e672c16befff03dcbf8f09b54560ed648d1cc1ada1","observation_id":"48c14eeb-f97f-4129-a2db-6a06d4b8c9d5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Systematic inequal- ities in language technology performance across the world’s lan- guages,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2ec474502b896688d417a77f9c2f332c4c457f19718d483f8714fd7bf4076bf9","observation_id":"c8ab55f5-178f-498b-8270-d14e74c4dd7e","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/0907568202009003043","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Appropriating cultural conceptions of childhood: Participation in conversation,","venue":"Childhood","work_id":"6705f803-b366-4738-828a-5e277c9e4df5","year":2002},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:15b2db4eb931192d2c5e7d4e4e7a6908b07c3c4f612e0d41e63bbcdcd78c1786","observation_id":"cd96ba7e-731f-4ba2-84b9-d8492389a234","resolution":{"observed_at":"2026-07-12T04:18:29.391418Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:20.602665+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:20.602665+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Word-minimality, epenthesis and coda licensing in the early acquisition of english,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8b9aaf226227581cbd7c7eea19f28527235c0debcf8ae1778d3de2b0b37beb2e","observation_id":"4d463c2c-aab2-4eba-9d7b-444aeed17e08","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Acoustical cues and grammatical units in speech to two preverbal infants,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7058fc7a0400ba590c0a715a351ee8fd50f28a389afa2797e7827dbef289c1aa","observation_id":"fef3fc8c-96ce-49cc-ac02-3041e0f05a63","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1515/cogl.2009.022","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Two-year-old children’s production of multiword utterances: A usage-based analysis,","venue":"Cognitive Linguistics","work_id":"0b171c74-69dd-4eb9-a737-68f598e10e95","year":2009},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8b9f6fc30584c1b6286bf62431c29418bec29fa456be0d5b369375dff699e8f6","observation_id":"50dd8b4d-6662-41ad-93b2-3e40a0a4e22d","resolution":{"observed_at":"2026-07-12T04:18:29.395696Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:21.146395+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:21.146395+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Construction and automatization of a minnan child speech corpus with some research findings,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:eeb74194770c17f78378e8b1811f12513482adecce841735e23e51be17522668","observation_id":"1724b42c-f9f5-4630-afe4-6ff7fcaf0844","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Ticuna conversations, 2018–19,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:31c76aba269b93a1a1a14108f4e2b1ef818b588266b097bdcd9c7acc77155c4e","observation_id":"652381e1-481b-4a72-a166-6656643d027b","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: https://cla.berkeley.edu/collection/ ?collid=11179","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:c6a346b9ce8e682756e13739d85677b7f1b95c63986a9dd2319ae816cbd5ab62","observation_id":"d61a3686-859f-42ed-9c96-bcac1a170234","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"BabyLogger versus LENA microphones: pilot study,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:39eefef0d3a68164ddcc3ef55527a4bc7126f4ba86fd21674143be9e0bd607cd","observation_id":"8c63cf4b-a0a0-49ca-b560-cb7da024fe85","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Bergelson Seedlings HomeBank Corpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2710f91e06a47d9e3186c3dbe3a6e124142fc744e28075eec00f923908bafd73","observation_id":"c254fe58-53a6-4ff9-a9ed-bb6134ba4a40","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"VanDam Cougar HomeBank Corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:c6bd64612b67130c399dced24d68ee2e6d0f05c532833429142d7d4f5930750d","observation_id":"bda4ba76-4421-4436-aea9-bacdfba9ba5f","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"FauseyTrio HomeBank Cor- pus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:a35dfb7061d5d716b2fba23e0afadd490f7e2d986cd43cfe4a1ec4f2d42f1883","observation_id":"09c397e5-ecea-4b29-9bb7-19ce281c6953","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The relationship between reciprocal family interac- tions and the language development of the younger sibling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:5f0765c759296fbb2cd0983e42d82d78954811ec87653afa589e7fd2faf272d3","observation_id":"434e5233-570c-4ce7-a1c6-0ff10861a573","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"A lon- gitudinal long-form dataset of 6–18-months-old Japanese infants’ auditory home environment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:5c423165c8b102a0c6c294136d25f26c9a5280364bc7bb467c8ba260db68f22e","observation_id":"c764497e-e8bf-45b3-a974-3c29ee389582","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The language 0-5 project,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e42db01f72922826531ea606b40e540e21f942494d53dc3936ffe726289acd47","observation_id":"1cdd2878-72b0-4eee-8567-8de5abfbd3ae","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Lyon HomeBank Corpus,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:43c44c0349f5ecf2df30166382d094a35010884236423704878932be71c2f978","observation_id":"329d5bf0-44a9-4034-be12-7b1830a421ed","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Long-form recordings from chil- dren growing up in various places in Namibia,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:ddc018d13129d4211aaee8ce00686cf1fc65f7bce621b0d044e8aa847f8dee58","observation_id":"85811ad9-da55-4326-883c-27fc5ef13acb","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"PhonSES: A pilot study to measure socioeconomic status association with infants’ word and sound processing,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d1524cb76ac9c4eb5c5f1fb17bbe9133db92572c63350cd920e87f3ba368df4f","observation_id":"77e767d6-a680-44bd-bf2a-3e99b2311b3b","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: https://gin.g-node.org/LAAC-LSCP/ phonSES-public","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7033a04993ba1207c66f05fd469e5111f960ac61b1e2b46137733fe4bb3cd455","observation_id":"c525de25-f61b-4fb6-a966-9311425cf1a5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Early language ex- perience in a papuan community,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2f36da3975946e79bc0786da53ee6de16131d45f4e6fb193e545be334e4b6e5d","observation_id":"e7172ae7-703d-47dd-ba7b-c98983f6fd37","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Long-form recordings from children in rossel island","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:5a9f7d334e8f61ef0d92a16ea77d24c6b818cc104f655d1f90852267810b46d8","observation_id":"e3699ea9-a44f-46ca-b9e2-7d987d1e1f6a","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Cychosz HomeBank Corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:0d1e4e1bbec2645ef82a8bc743d53486699da20b7f9ddcd0d2dd20bdaaf8c29f","observation_id":"488cec49-a495-44bf-8ffc-1e15348b9e77","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"It makes a village: child care and prosociality,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:c49129d08dca3569e14d0ac082a392cc9c95ff1bfc46943ba2475fdde4e2a858","observation_id":"b648cd91-a2e2-46fd-b498-9bbb06fff5cc","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Long-form first-period recordings from children in timor-leste,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8c2ce1b1c748da17cddcb225637b11ba3579d6d3cb9899f25606f5cff284a191","observation_id":"14cf2e34-2979-4a7a-bc0b-8edeb6b65552","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Casillas Home- Bank Corpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:608b062e265f05df7784282147d4ea5655fa9b031e6aa2cbb2541f05cdd3bbde","observation_id":"087c5e0c-e2c0-4a73-bb96-9e83c2b1aabd","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/infa.12568","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Characterization of children’s verbal input in a forager-farmer population using long-form audio recordings and diverse input definitions,","venue":"Infancy","work_id":"cc16b331-ba4f-4b6e-a4cb-0bcb54b7352a","year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:9193ecc3118a05cf76903b0e0ceb23389e9088244655cd90f4aa7cf0f9f59f28","observation_id":"2c1bf370-8e3f-4284-b8a5-b65a4526172a","resolution":{"observed_at":"2026-07-12T04:18:29.382568Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:21.399613+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:21.399613+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/desc.13375","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V ocal input and output among infants in a multilingual context: Evidence from long-form recordings in vanuatu,","venue":"Developmental Science","work_id":"909150d9-1a01-4b06-969c-cb7e06170e2b","year":2023},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:bdf36bb49b86f177b3b0468d2224ce2562cd5004ca1de7f61c9aaece935393c4","observation_id":"e27e2d4f-b697-46e7-9dbe-f45203704df6","resolution":{"observed_at":"2026-07-12T04:18:29.387055Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:21.724413+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:21.724413+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"San Joaquin Valley HomeBank Corpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:6cd03febc8cf304fd3ad35ab9016576929a0403021d63a666dc2e8ad694a5373","observation_id":"9bb4d0bf-f6c9-44de-b7f5-43cb71cdfad1","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Winnipeg HomeBank Corpus,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:3c6d88b8ecfdbc3ccfdcae00c9ab82d4585ff11ef712a57dcb1746eb2b41866d","observation_id":"f73928e5-5649-4beb-816c-fba5677d6703","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The interspeech 2017 computational paralinguistics challenge: Addressee, cold & snoring,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e08d1edaf9bb869f7e09616aee303cc72b0cbf891dbf1a4c56b758f0bfd1383b","observation_id":"0aad8b52-0f3d-4792-bd3b-612a84ba3243","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Developing a cross- cultural annotation system and metacorpus for studying infants’ real world language experience,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:0155116a9c46ccda465c7382d1dbf7e9662fe19f011e25f74408b1aa2506a552","observation_id":"e008eec9-595a-4cee-89df-88611b3eba67","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The interspeech 2019 computational paralinguistics challenge: Styrian dialects, continuous sleepiness, baby sounds & orca activity,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:99f2ea1b3b236e73e29f8ace96fcc439fca7080600759d8b85968383abf70f5e","observation_id":"09941087-ebbc-4c89-8566-e01c501e8816","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Employing self-supervised learning models for cross-linguistic child speech maturity classification,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:13346c24aeff2539ef14d0a7af05636cf067fc03c502f8633ee04b058211e35d","observation_id":"5c2133ec-94a7-47ac-910d-dd72dbabb1ed","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08999","last_updated":"2025-06-10T17:20:02Z","snapshot_observed_at":"2026-08-08T01:50:12.155817Z","submitted_at":"2025-06-10T17:20:02Z","title":"Employing self-supervised learning models for cross-linguistic child speech maturity classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08999","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: arXivpreprintarXiv:2506.08999","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2506.08999","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:65698cc4a65f0df187a4a9feb50f517226d14c27afba4a54dad2009bef2f4f63","observation_id":"c0adee27-d937-4107-9d09-7d99c3a63052","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Decoupled weight de- cay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:0045fb1010849c261602e65ea1f3a0d6157753bbe5228fef70768da89f418436","observation_id":"7b156a03-78d1-4b6a-b6a5-8eab03e7d3c8","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T14:26:17.916824Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2607.03201."}