{"as_of":"2026-08-10T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12c4e646c1b00d26c13d7098623a7c020e64a4e4e109258013ae41b6f919d9fe","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:11.832886Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:09.479147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:51:12.675415Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"cited_work":{"arxiv_id":"2506.01365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01365","snapshot_observed_at":"2026-08-07T11:51:12.675415Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","venue":"cs.SD","work_id":"2639f9a8-95c0-4fe1-ae4d-106424684ed2","year":2025},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.479147Z"},"links":{"cited_paper":"/paper/2506.01365","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:b64bbeabd31a2a29e75763e65d40aec91e12c90903880be95754e5549a0153f1","observation_id":"939a4c94-c33e-41bb-a9eb-1d76b740d270","resolution":{"observed_at":"2026-08-07T11:51:12.791241Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01365/citation-record","integrity":"/paper/2506.01365/integrity","json":"/paper/2506.01365/citation-record.json","paper":"/paper/2506.01365"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.264630Z","title":null,"venue":null,"work_id":"7c98ac5b-c418-4755-b73a-fe2b08c75358","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.419307Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:94417d597e9bc9092ed52ece41ec86e8cad1bab748ca9cdf915661c3c0a99d2a","observation_id":"ef798b6f-3a92-45cd-b13b-cb6e7ab9bd21","resolution":{"observed_at":"2026-08-07T11:51:16.275042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"cited_work":{"arxiv_id":"2506.01365","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01365","snapshot_observed_at":"2026-08-07T11:51:12.675415Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","venue":"cs.SD","work_id":"2639f9a8-95c0-4fe1-ae4d-106424684ed2","year":2025},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.479147Z"},"links":{"cited_paper":"/paper/2506.01365","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:b64bbeabd31a2a29e75763e65d40aec91e12c90903880be95754e5549a0153f1","observation_id":"939a4c94-c33e-41bb-a9eb-1d76b740d270","resolution":{"observed_at":"2026-08-07T11:51:12.791241Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.238469Z","title":null,"venue":null,"work_id":"0f5834b1-e2ff-4a1b-8d3b-6d806c974323","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.538212Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:19ba8cf6954735da59c3364446492612aec922474b35c2faa70a80fd9d54e591","observation_id":"7d51e26a-34d5-40f0-8512-f376cac3e2b3","resolution":{"observed_at":"2026-08-07T11:51:16.248660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.212049Z","title":null,"venue":null,"work_id":"0516af04-6340-42a3-9134-c222bad5fbb4","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.594732Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:8133d42a1395fa2b4986fb1cfe5d1d87e5503056478810db8e7ea5dd62b46639","observation_id":"37bfde91-3d9f-43eb-8622-27d6fb12c8ff","resolution":{"observed_at":"2026-08-07T11:51:16.220498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.179005Z","title":null,"venue":null,"work_id":"7c4aa655-129a-4d48-ab17-bfe9e72afb30","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.640441Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:5601f343367d6d2cd3d7a2f87fc7a10b9ccace7684d573dc8ddd2b7dca2f74cd","observation_id":"12d97d49-01a5-4d69-842c-ece9c0f60556","resolution":{"observed_at":"2026-08-07T11:51:16.192287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.153903Z","title":"MFCC vs PTM Features Pre-trained model based features have proven effective for various speech tasks, including V AD","venue":null,"work_id":"6adfd1ea-b3c7-4483-8e0a-5db19396da1f","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.706274Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:de4c022edaf28d766503b635f33996b3563c04de0328d3e77f12623be1e027a0","observation_id":"833c88b7-5636-4adb-96dd-659c7764811d","resolution":{"observed_at":"2026-08-07T11:51:16.162184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:16.056340Z","title":"Dataset and Evaluation Metrics We conducted all our experiments on three publicly available datasets, i.e., AMI, Callhome, and V oxConverse, to ensure do- main diversity","venue":null,"work_id":"12f8c1ce-829f-4e4a-93f2-126b445a5d50","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.750716Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:26276eedb8d5e9bb1523c37b0638123dab3291732064a29b1650dab3314da42b","observation_id":"49fb3993-86dd-45c4-a184-64e4fb714be2","resolution":{"observed_at":"2026-08-07T11:51:16.136028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.788261Z","title":"A survey of convo- lutional neural networks: analysis, applications, and prospects,","venue":null,"work_id":"9b634fb0-6297-4cae-b7f1-8a18bc45d81c","year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.213444Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:3c7f62536274a5ad1eddba4b52526fdaaf6b29a97549df81b2f0e9e7a568c40a","observation_id":"3ef24849-27fb-4d4d-8e30-9ecf004c37ac","resolution":{"observed_at":"2026-08-07T11:51:14.879696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.718276Z","title":"MFCC vs PTM Features First 3 columns in Table 1 shows the performance of V AD with individual features in terms of DER, FAR and MR","venue":null,"work_id":"806b11e6-6b72-4caa-bb94-f1f2e9c93f15","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.860129Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:5074aec3cedd29601515f526e5664c33b1d06b90986e3875b1a4d45c549bc520","observation_id":"d398ae63-8724-4b6a-9f6b-eb80523e5a3e","resolution":{"observed_at":"2026-08-07T11:51:15.789229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.586020Z","title":"Our experiments show that simple fusion methods like addition and concatenation consistently outperform the more complex cross-attention mechanism","venue":null,"work_id":"20e16a87-c4c5-4422-a30b-0d86b07cd388","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.900221Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:e32dc5d3d49bc48aaedf5eef56731b1adf5ad76a96571b83439fb37ed222918f","observation_id":"eec9b035-31f0-4487-b22d-453ef6f20906","resolution":{"observed_at":"2026-08-07T11:51:15.646275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.559931Z","title":"Temporal modeling using di- lated convolution and gating for voice-activity-detection,","venue":null,"work_id":"ca9ada6b-fa05-4e4b-9a35-142ec2b1e445","year":2018},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.938166Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:126d4faddfd5b177054afcc685be84af62d24c7c0f7a66ccbe02309699ecd44b","observation_id":"b7cf4512-d6fe-4bc2-90b6-bc82a25d59b4","resolution":{"observed_at":"2026-08-07T11:51:15.569898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.411025Z","title":"Wavoice: An mmwave-assisted noise-resistant speech recogni- tion system,","venue":null,"work_id":"8aae9364-59a4-42d3-b2f3-72007ebacfd4","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.973317Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:36f4b542fbda50cbcbf4af611ab654767e5ca8134cf684beaec771ca8b1455ae","observation_id":"fd8a25d1-d16d-4e32-bb0e-4e3e79db3956","resolution":{"observed_at":"2026-08-07T11:51:15.488071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.261457Z","title":"Profile-error-tolerant target-speaker voice activity detection,","venue":null,"work_id":"ff4101af-0712-4644-8a51-500c73b2424c","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.016834Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:729a2cc60c5985bc885ebdc991ea89d05b4b61af5078c3b3238b07c1444a2f34","observation_id":"8222dd9d-4393-4bb4-a8cb-5ce5f7d8b7f2","resolution":{"observed_at":"2026-08-07T11:51:15.321383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09142","last_updated":"2024-05-15T07:13:24Z","snapshot_observed_at":"2026-07-06T18:14:33.618470Z","submitted_at":"2024-05-15T07:13:24Z","title":"Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2405.09142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09142","snapshot_observed_at":"2026-08-07T11:51:12.440616Z","title":"Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization","venue":"eess.AS","work_id":"8639a631-897f-4211-aec6-09ec35603df3","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.058899Z"},"links":{"cited_paper":"/paper/2405.09142","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:e72794ada82ab457f3e338aada2544b10fda8fc001aeae01c154473c112ebe60","observation_id":"679a867e-043f-416a-8b01-a477f1d0aee5","resolution":{"observed_at":"2026-08-07T11:51:12.535791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.111769Z","title":"Unveiling the state-of-the-art: A com- prehensive survey on voice activity detection techniques,","venue":null,"work_id":"c61cbebb-f801-41e9-91d9-ca70221a120d","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.100937Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:94553213322d215e7ed92eb8076de1a379371ba15077570fbe688ad187c35f38","observation_id":"e10244b7-7dfe-4a9b-b0ec-2a8203743f11","resolution":{"observed_at":"2026-08-07T11:51:15.185183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.995993Z","title":"V oice activity detection: Fusion of time and frequency domain features with a svm classifier,","venue":null,"work_id":"226d54c2-17c6-4113-a30b-23e304eba749","year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.141767Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:8d18b225a2c0408b3c9b8eaf42c2de3f3d7fa86acf7dc7d6ebbae3b3f4287572","observation_id":"783b5cb6-c1da-48ec-9972-8751fff5b9c9","resolution":{"observed_at":"2026-08-07T11:51:15.036588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.969370Z","title":"Analy- sis of derivative of instantaneous frequency and its application to voice activity detection,","venue":null,"work_id":"d0e44f00-ce3b-4211-b55f-78b0ff09a8f7","year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.179305Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:8fc8c1718536d991ab5a62f5c28041ca0e9a517e4ef2c69307b3087d0085d1f0","observation_id":"5cc4d5a4-f4aa-4fa3-be5d-d4802a5ec1f3","resolution":{"observed_at":"2026-08-07T11:51:14.979766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.788432Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.788432Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:58e12d331bf688a02ae7f49c0ca7e5c655d22c2008db8bddc955b874a77a1dca","observation_id":"65f42d73-cb2d-4211-8c63-256f6bbaf333","resolution":{"observed_at":"2026-08-07T11:51:10.788432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.760352Z","title":"A review of recurrent neural networks: Lstm cells and network architectures,","venue":null,"work_id":"76be627c-e57f-4d89-83c6-8b5342d72186","year":2019},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.265665Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:e972a3ee26fc7e285bc0e1cd5899bcb55eb25e786e47e3392e297743919c96e0","observation_id":"f763f485-49cf-42f7-932f-47987f604b98","resolution":{"observed_at":"2026-08-07T11:51:14.767898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.621488Z","title":"A hybrid cnn-bilstm voice activity detector,","venue":null,"work_id":"d932f61e-0192-4d86-ae04-3ea7c7133b3f","year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.304986Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:1439e1588ea735ff507371d294b1b7654f04aa013e3dc874760d7cce61037bf2","observation_id":"4266d00f-cbff-4121-94cd-08e422b1343e","resolution":{"observed_at":"2026-08-07T11:51:14.698211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.417481Z","title":"Feature learn- ing with raw-waveform cldnns for voice activity detection","venue":null,"work_id":"3880dc86-76a7-4158-b84b-bccabbe2a549","year":2016},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.357047Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:3e420ea9bc25559a5f6f028cca3d1f23c951d841436139f4645a73f7bdbe1c90","observation_id":"aa3820dd-fd68-4e94-998e-3ed5b946acf6","resolution":{"observed_at":"2026-08-07T11:51:14.505567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.407683Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.407683Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:be1ad406f8f2b2e3fe9538e550a1e41a1ae9d692bab3f25b74c1432185019890","observation_id":"e16e1dc1-7fb9-485b-80d5-66fac811bdc7","resolution":{"observed_at":"2026-08-07T11:51:10.407683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.456958Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.456958Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:4df77a7fc0b89724449e17204fe675b559d46d8c99680ac5b97690afd9eb2d17","observation_id":"867f4b01-b5f4-4431-988b-1c5c344019ba","resolution":{"observed_at":"2026-08-07T11:51:10.456958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.503910Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.503910Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:f0c79bb87e495e1efe982fe2f1a60f8405e8c9a80074753fc84b3b7802392629","observation_id":"2bec1e50-8035-4bad-a19a-a50b21c65200","resolution":{"observed_at":"2026-08-07T11:51:10.503910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.246861Z","title":"A closer look at wav2vec2 embeddings for on-device single-channel speech en- hancement,","venue":null,"work_id":"18b338e3-0bee-414f-9631-d8ba05ec24c2","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.585637Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:64eadbb014929770d8ba388560ecd101ea5a317d894690f49e5bc4f0f8a47354","observation_id":"e161ca1d-c447-43eb-a71c-267d0ee7f257","resolution":{"observed_at":"2026-08-07T11:51:14.316717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:14.166524Z","title":"Unispeech-sat: Universal speech rep- resentation learning with speaker aware pre-training,","venue":null,"work_id":"9bc08425-a53a-473c-a3b3-aace98db4be3","year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.643292Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:f7a45c42c9762b7d4009a53f8b4c7fd733273327adf412633a42303e1812e11e","observation_id":"13345372-e7a2-4b62-a873-1fdfa45bfc5e","resolution":{"observed_at":"2026-08-07T11:51:14.190460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.710355Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.710355Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:acad004e51262f5d8e71c00596a61daa290cb69725c1750ebd6aafb29569270e","observation_id":"775471c7-0d58-4ada-adc7-fc7114dd8980","resolution":{"observed_at":"2026-08-07T11:51:10.710355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01216","last_updated":"2021-08-15T04:01:36Z","snapshot_observed_at":"2026-08-08T09:12:33.976519Z","submitted_at":"2020-07-02T15:55:54Z","title":"Spot the conversation: speaker diarisation in the wild","version":3},"cited_work":{"arxiv_id":"2007.01216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.01216","snapshot_observed_at":"2026-08-07T11:51:11.943564Z","title":"Spot the conversation: speaker diarisation in the wild","venue":"cs.SD","work_id":"89acf94a-ad21-4289-a608-3c41e6896ea6","year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.586294Z"},"links":{"cited_paper":"/paper/2007.01216","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:d667b63477018b58dd3288e70cb17682c3e4d03568ea8e0001280642f983dc1e","observation_id":"b353c641-69c0-46cc-baa6-6a632f777a94","resolution":{"observed_at":"2026-08-07T11:51:12.046250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:15.890857Z","title":"Base version checkpoints are considered for wav2vec 2.01, Hu- 1https://huggingface.co/facebook/ wav2vec2-base BERT2, WavLM3, UniSpeech 4and Whisper5","venue":null,"work_id":"7ef3bf75-2285-44c9-be60-bd904ea886ca","year":null},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:09.817109Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:33f31186f8a3b0cc80e6937771c1107dae5153fafab0dcbf03c49b3d421a798e","observation_id":"70e2a298-5d4d-4288-8bcd-cfa4935a237b","resolution":{"observed_at":"2026-08-07T11:51:15.960782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.873019Z","title":"Enhancing whisper’s accu- racy and speed for indian languages through prompt-tuning and tokenization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.873019Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:5d35209baf2dfc5fbaf661e97737762d84c04a2ee2207688e33775d35eece884","observation_id":"53a273fc-365b-4118-93fa-4e73e37f9a8d","resolution":{"observed_at":"2026-08-07T11:51:10.873019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:10.961151Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:10.961151Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:e9189cf8536220872124887e0b910a9db0d5f3310f6c674622e7de5d65e8937e","observation_id":"06ccb6e3-9ae4-49cb-a111-d5754034baee","resolution":{"observed_at":"2026-08-07T11:51:10.961151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17796","last_updated":"2024-12-23T18:53:15Z","snapshot_observed_at":"2026-08-04T11:37:53.484880Z","submitted_at":"2024-12-23T18:53:15Z","title":"Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17796","snapshot_observed_at":"2026-08-07T11:51:11.040230Z","title":"Investigating prosodic signatures via speech pre- trained models for audio deepfake source attribution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.040230Z"},"links":{"cited_paper":"/paper/2412.17796","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:132262aa661445452e36212b1a3723c178ed81d6cad72c332dce73ff4d9771b5","observation_id":"620f9e5c-8bd2-4289-90f8-8bc9f2f8eaeb","resolution":{"observed_at":"2026-08-07T11:51:11.040230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12947","last_updated":"2024-10-16T18:34:06Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:34:06Z","title":"Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks","version":1},"cited_work":{"arxiv_id":"2410.12947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12947","snapshot_observed_at":"2026-08-07T11:51:12.211279Z","title":"Multi-View Multi-Task Modeling with Speech Foundation Models for Speech Forensic Tasks","venue":"eess.AS","work_id":"2717fe35-f0bc-4c97-85d1-b0abaf8b4732","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.101007Z"},"links":{"cited_paper":"/paper/2410.12947","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:5430814f688afea97e985a4374f2b4ca6590ba73251382e9fe308c30919fc235","observation_id":"6c1ee7fe-557f-4c6b-880a-fb3f624a8a3d","resolution":{"observed_at":"2026-08-07T11:51:12.273028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.897407Z","title":"A transformer-based voice activity detector,","venue":null,"work_id":"2314ac57-652d-4727-9142-edb046315d8e","year":2024},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.169108Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:82e913caaa4597c25ebda9641c92dfd2c6b496b03e08d8ea1cb94a5390d51a79","observation_id":"b3150781-14ea-40fe-8a97-74a8b0ef0d2f","resolution":{"observed_at":"2026-08-07T11:51:14.040176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.666338Z","title":"Multitask detection of speaker changes, overlapping speech and voice activity using wav2vec 2.0,","venue":null,"work_id":"4878218c-9a12-48c3-b369-ad048ba2aee3","year":2023},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.271319Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:9de81e168aea386e09e89a5bf8e01882d5c62661e163d620e88ce30958593dd8","observation_id":"b382a52b-bbd2-47fe-b586-6774fcc0acad","resolution":{"observed_at":"2026-08-07T11:51:13.742840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.529009Z","title":"Feature extrac- tion using mfcc,","venue":null,"work_id":"3be0fd15-d1b2-4f2b-ba72-848eb41b89b7","year":2013},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.374716Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:52008a34b4e61ba22a90467f4efdd0085ff6268822073661556f947a80e17172","observation_id":"b5687662-d01c-41fe-a795-98a53b41442f","resolution":{"observed_at":"2026-08-07T11:51:13.589638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.396090Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything ami meeting corpus,","venue":null,"work_id":"3ce7f9ee-5435-4db8-97f4-75ec9fdf9b3b","year":2007},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.439124Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:f9d2b2cdadc7f67bc0497a9c9796a8a31ac7656608bbf891389af1b3e6b84ddf","observation_id":"4b3137c4-f96b-4e44-ad1f-7748b7e574d7","resolution":{"observed_at":"2026-08-07T11:51:13.459115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.280271Z","title":"2000 nist speaker recognition evaluation,","venue":null,"work_id":"81366b7b-bcf1-499d-81bf-1e938291c69d","year":2000},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.507324Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:352a38963a2ed10f240c95dceb63b1bc648b98e577db6c6c2378005003dfcce2","observation_id":"d0a65c65-e5e5-4e6c-87d4-a2e1b5cc3b28","resolution":{"observed_at":"2026-08-07T11:51:13.335994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.199278Z","title":"Pyannote. audio: neural building blocks for speaker diarization,","venue":null,"work_id":"03da1fb8-59cf-466f-b98b-0cf71fd20adb","year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.666189Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:b06c4356d69f0a60baa755dde1934e89233c065194f1e4c21eebf1e5c7e61c3d","observation_id":"46a94862-248c-4110-ad59-a7f343668c0a","resolution":{"observed_at":"2026-08-07T11:51:13.227135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04045","last_updated":"2021-06-10T13:51:47Z","snapshot_observed_at":"2026-08-09T15:17:17.336194Z","submitted_at":"2021-04-08T20:38:17Z","title":"End-to-end speaker segmentation for overlap-aware resegmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04045","snapshot_observed_at":"2026-08-07T11:51:11.727872Z","title":"End-to-end speaker segmen- tation for overlap-aware resegmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.727872Z"},"links":{"cited_paper":"/paper/2104.04045","citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:113b252aed3c7c5f58151a1b62659ce979fabb6a083f3278b42a28d02c4c0555","observation_id":"98c46501-02bf-4a18-b6c4-d86355140ca6","resolution":{"observed_at":"2026-08-07T11:51:11.727872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:13.083025Z","title":"Speaker recognition from raw wave- form with sincnet,","venue":null,"work_id":"f4eb984f-dcce-4c72-a397-00da0ffdc467","year":2018},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.759953Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:56de6dbc6ab1c6936f4698d552064338279c2d0720a7a62beb620e6e364ec969","observation_id":"8372bbce-579c-4296-9b7d-c874a795c96a","resolution":{"observed_at":"2026-08-07T11:51:13.170204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:12.985988Z","title":"rvad: An unsupervised segment- based robust voice activity detection method,","venue":null,"work_id":"362a9212-aaf0-4c25-96e0-1eaf3c0c1af1","year":2020},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.789628Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:9717663575fc92beeaf92f547090d4bb79fd7f39840289f430a97885306c4225","observation_id":"a3c4611a-7a41-452d-b56e-3aa0e059262c","resolution":{"observed_at":"2026-08-07T11:51:13.021646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:12.893014Z","title":"Boosted deep neural networks and multi-resolution cochleagram features for voice activity detec- tion","venue":null,"work_id":"8bb044e6-34d2-4d2f-8251-0a942bf768ff","year":2014},"citing_paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:11.832886Z"},"links":{"citing_paper":"/paper/2506.01365"},"observation_digest":"sha256:651f5d6d0a180c26ef650b01cf64c67475826572aef6a4a9fb19f2f4261329a9","observation_id":"49dbc3c4-1c47-4149-b9ef-c03473418d92","resolution":{"observed_at":"2026-08-07T11:51:12.933562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01365","last_updated":"2025-06-02T06:47:42Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T15:18:23.415156Z","submitted_at":"2025-06-02T06:47:42Z","title":"Attention Is Not Always the Answer: Optimizing Voice Activity Detection with Simple Feature Fusion"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2506.01365."}