{"as_of":"2026-08-10T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c573c735f8dc0829b49a4fe9e88f96f6a5dd32ce73f557ed1171a68afbf916db","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:23.650061Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:19.199833Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:55:23.785586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01133","snapshot_observed_at":"2026-08-07T11:55:23.785586Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","venue":"cs.CL","work_id":"827c220c-30bd-425a-a1c2-a839ad12f9e7","year":2025},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.199833Z"},"links":{"cited_paper":"/paper/2506.01133","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:4359c97049e79860da4e39ecfe004fad84fc106b6fcd90b2989fcab6e071a03b","observation_id":"ff3e0a17-38ff-4eb3-88ca-76261b5660ad","resolution":{"observed_at":"2026-08-07T11:55:23.792506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01133/citation-record","integrity":"/paper/2506.01133/integrity","json":"/paper/2506.01133/citation-record.json","paper":"/paper/2506.01133"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.705821Z","title":"Among these, large language models (LLMs) have demonstrated emer- gent capabilities once thought to require human intelligence","venue":null,"work_id":"5e6084b7-fa4a-4556-8b04-b5cd3a2b9f52","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.162130Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:6542c5354ec1c7e3d679c554544fb1e4133cad6adc4404b6a413e7d26a0c1b31","observation_id":"f91442a7-2fc5-4d1a-b385-d937125a5a34","resolution":{"observed_at":"2026-08-07T11:55:27.712585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01133","snapshot_observed_at":"2026-08-07T11:55:23.785586Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","venue":"cs.CL","work_id":"827c220c-30bd-425a-a1c2-a839ad12f9e7","year":2025},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.199833Z"},"links":{"cited_paper":"/paper/2506.01133","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:4359c97049e79860da4e39ecfe004fad84fc106b6fcd90b2989fcab6e071a03b","observation_id":"ff3e0a17-38ff-4eb3-88ca-76261b5660ad","resolution":{"observed_at":"2026-08-07T11:55:23.792506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.677984Z","title":"We investigate both unimodal and multimodal models, focusing on HuBERT, BERT, Seamless M4T, and SpeechT5","venue":null,"work_id":"159f3e06-53f7-4761-95a6-4a570b2fafb3","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.267030Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:e9e488c018ef5549207a2f2554042dcf298f9843851cc54fafc78c7926dd92dc","observation_id":"ee33b07d-9131-4069-a6d5-f7c695aeb71a","resolution":{"observed_at":"2026-08-07T11:55:27.693002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.647373Z","title":"w_1\", \"w_2","venue":null,"work_id":"188251ae-6fcd-4a84-9fcd-44f3fe1d8214","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.331834Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:68a00e4001884f81450ef4a6d4344d5da789332d747ccbfcd14ea601f17720a3","observation_id":"c5de2cd0-74f2-400a-94cc-e59b14b90cd6","resolution":{"observed_at":"2026-08-07T11:55:27.662099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.514068Z","title":null,"venue":null,"work_id":"f4712252-a05f-417e-b4b4-a0d8a3e9bbd6","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.417471Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:61a339159cf9c4e16ecb539899e4e63d4af1260d6eea3edd9554dbcf6e12185d","observation_id":"6c2ac4f5-3bf7-4b3e-9044-572dd89044ef","resolution":{"observed_at":"2026-08-07T11:55:27.556058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.261383Z","title":null,"venue":null,"work_id":"912a25fb-5f46-4614-a4bd-169a08330d7f","year":null},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.504535Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:1e776dfb727fd1f047b6d930d68ad2730c1ecc31112f4324bd634e4e3772dbda","observation_id":"cf97432e-1b33-4b8e-8820-c6950a0eac18","resolution":{"observed_at":"2026-08-07T11:55:27.387066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:27.069103Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4,","venue":null,"work_id":"ef8ee178-b46b-4cf8-8584-9ee54087fc65","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.583130Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:f43d8e069a2234d75597bd3b337d36a80964d9ca0238532f1daf1cfaa74157aa","observation_id":"4aa22244-a4b7-4eb8-a778-35ff77b33a6b","resolution":{"observed_at":"2026-08-07T11:55:27.220805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:55:19.678444Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.678444Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:2f49dcb634c0b0b341901f63ed481c3acebf7ce81c5fc42814e7e1c40c2a5dca","observation_id":"651a6269-6e48-46a1-b3f1-48a56e9347e9","resolution":{"observed_at":"2026-08-07T11:55:19.678444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:55:19.822671Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.822671Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:c26610a290553034714f60253d02df551753fd239de15cb46c84be3ae12bcb12","observation_id":"ffb8be02-a770-43d3-bfa3-2b9563656d3c","resolution":{"observed_at":"2026-08-07T11:55:19.822671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:55:19.917109Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.917109Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:a7aaf2ee1a77acc144f05b96253a8556bbcc9630db6bd895761d3fae2f19decf","observation_id":"3ec040d0-97c7-4bd1-87e6-6d063b702c32","resolution":{"observed_at":"2026-08-07T11:55:19.917109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-07T11:56:57.969083Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-07T11:55:19.930713Z","title":"Humanomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.930713Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:03a4a57f69f6fd78c771381e79d24e17ebe1ff837b7e5cd4ce78b6af555d5082","observation_id":"6a2b2aea-b7d0-4516-80ab-a56c46060c39","resolution":{"observed_at":"2026-08-07T11:55:19.930713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.795021Z","title":"Chatgpt makes medicine easy to swallow: An exploratory case study on simplified radiology reports,","venue":null,"work_id":"794ce83b-b25d-4119-9189-129dfeb1b279","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.085297Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:859ca739d09fe4611b3329aae569ff6421dc13b70cfbccf35434890e5711e4ea","observation_id":"3e4f3261-254a-4e83-90a7-ff72616d9a5f","resolution":{"observed_at":"2026-08-07T11:55:26.928313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.516913Z","title":"Where do you know what you know? the representation of semantic knowledge in the human brain,","venue":null,"work_id":"72679e0e-26f4-4a8e-88c0-132f51c35985","year":2007},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.213457Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:c9b94518d6d1645900ba0ccab33fa8bbe4963fca895c085dd3ed10655598cd57","observation_id":"3574e071-210c-4673-b75e-8b7572492bea","resolution":{"observed_at":"2026-08-07T11:55:26.649923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.247646Z","title":"Discovering latent concepts learned in BERT,","venue":null,"work_id":"9461a58c-7427-42ba-a2ce-602e61c456f3","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.278799Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:2e05b5437cb66f77a84473fb70f7c73642d437397036e30a4856fab046d6f7d2","observation_id":"a86651e7-ab95-439e-800f-460cfb06a8a5","resolution":{"observed_at":"2026-08-07T11:55:26.404067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:26.015777Z","title":"Asking without telling: Exploring latent ontologies in contextual representations,","venue":null,"work_id":"3f228497-afad-4c78-a8ed-0fd5a5e99faa","year":2020},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.386867Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:337673eb475799e3c766feec893d16dcd7033bff816acf9460b21fd8e9c15430","observation_id":"44907d11-e6c7-4baa-aaa6-ef31c6a3d378","resolution":{"observed_at":"2026-08-07T11:55:26.128856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.743824Z","title":"Acoustic word embeddings for untranscribed target languages with con- tinued pretraining and learned pooling,","venue":null,"work_id":"80866745-1c30-45cf-8d4b-601d5b789147","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.549216Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:bc4665c3d3d09f103af76c7ef06c6d2713d00733ea400de60506d97e6f0053cb","observation_id":"6f34368a-90b5-40ea-8d8d-3fa1d0b611fd","resolution":{"observed_at":"2026-08-07T11:55:25.860399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.569491Z","title":"Scaling up discovery of latent concepts in deep NLP models,","venue":null,"work_id":"1023e7dd-416b-4feb-85e8-79c90cb6a918","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.672485Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:9c98a390734ec061bf065e1a0e18af8fd71db42f967d73e1f78577d96e60472c","observation_id":"aa5e3386-fc3c-4045-9202-201ae47d99cd","resolution":{"observed_at":"2026-08-07T11:55:25.678059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:20.796229Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.796229Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:25efba6d3e5b8785c63bf2da99a0d166f1c7a2be1997feb9b037074619777a90","observation_id":"a3c011e6-a16b-45fa-b5a7-befe2d8c2545","resolution":{"observed_at":"2026-08-07T11:55:20.796229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.293314Z","title":"BERT: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":"4c0c38dd-2f40-4898-9371-8ff9df300c00","year":2019},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:20.915431Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:2cbca057a270128d29eeccca97c411f9a3bec5e0433e837c9910746058947f66","observation_id":"35bc41e9-76a6-460a-8124-d4965bf872a8","resolution":{"observed_at":"2026-08-07T11:55:25.429411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:25.038403Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":"4dd29d77-b67c-41a2-bb78-441528f8e4e6","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.002271Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:d1ecdb4495d6038da6db13644331eea1ec89aa4e143dbd96b185b4f6813f9c23","observation_id":"f36093cf-aaf2-4d97-8f30-30cb5b92a0bd","resolution":{"observed_at":"2026-08-07T11:55:25.162198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.786508Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,","venue":null,"work_id":"6b22b33b-62f1-4fb6-ba4c-66539250e06b","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.207897Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:31ae6a444dc3ad4a19cc87f2d39b37ac296103deadc100f7c717ce02e4aa6f8b","observation_id":"b0a1f3d9-fad8-4b71-a9e0-6d1850727749","resolution":{"observed_at":"2026-08-07T11:55:24.921538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.704457Z","title":"Building a large annotated corpus of English: The Penn Treebank,","venue":null,"work_id":"50655506-b5dc-4cbe-9900-64c18276efe5","year":1993},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.346221Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:0aa5c917c95e5adbac8e2dfb56bbb4c53d67996337838531c99b129fc9b03da1","observation_id":"84a95c81-3ccd-49b1-b5dd-80f99f94c64c","resolution":{"observed_at":"2026-08-07T11:55:24.738695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.641293Z","title":"Introduction to the CoNLL-2000 shared task chunking,","venue":null,"work_id":"064bce9a-9ad3-4523-b780-240e851a25b3","year":2000},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.487297Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:f0a03cbc88c3c40fc46a5dbe266565c266c043dd24d4bca280dc9a069f565fec","observation_id":"72ea7388-dbe1-4226-ad6e-505cc74dd8f8","resolution":{"observed_at":"2026-08-07T11:55:24.670928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.574495Z","title":"The parallel meaning bank: Towards a multilingual corpus of translations annotated with compositional meaning representations,","venue":null,"work_id":"e9eb81bf-4924-4294-9c52-77539c14ca75","year":2017},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.617635Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:a3da1d933bc3cebf7f918d4404269d700af545469e91997a2d83476f68958464","observation_id":"65fe5955-f0a3-4a0e-bead-19a0c8e8f193","resolution":{"observed_at":"2026-08-07T11:55:24.602280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.524004Z","title":"Recursive deep models for semantic composition- ality over a sentiment treebank,","venue":null,"work_id":"abc7c019-9ba1-4503-b875-12487e405fcc","year":2013},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.768001Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:03c22974b79de36c9baf64c0f187d41288ee82001f1a6fe89624898b0a58654b","observation_id":"48838c32-24d8-49da-9671-d6067eed0145","resolution":{"observed_at":"2026-08-07T11:55:24.553141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.454012Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"4e60440a-7821-460c-ac22-80544da28a9a","year":2015},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:21.954269Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:ba0352dbb902393c1f3e3571ed95e18408699c3f18d2af90b964238773ea06a9","observation_id":"39df574d-4f0a-44ee-b939-f568c7052dda","resolution":{"observed_at":"2026-08-07T11:55:24.498049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.410592Z","title":"Neurox library for neuron analysis of deep nlp models,","venue":null,"work_id":"213deebd-a7d5-4fdd-8aa0-073256b50580","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.157959Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:36cf62041fe0b238f51d2020a1f7f28375821c7ee643edf9b94abefe166c2356","observation_id":"11f5eb42-d58e-4a24-8e3d-ca9970609204","resolution":{"observed_at":"2026-08-07T11:55:24.428683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.345813Z","title":"GLUE: A multi-task benchmark and analysis platform for natu- ral language understanding,","venue":null,"work_id":"35c0c623-4e43-4f0d-a120-c49a28ab7cef","year":2018},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.262570Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:e268e67089b53f920895b8c1c2ccf89852430d84f8d69ef45a7ad2d1515f04ea","observation_id":"73060970-d9a3-4e2b-885f-5e320325eee1","resolution":{"observed_at":"2026-08-07T11:55:24.370606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.277490Z","title":"Slue: New benchmark tasks for spoken language un- derstanding evaluation on natural speech,","venue":null,"work_id":"0e9934f4-5029-4733-80c5-97e8455d1753","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.379904Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:78270a8d361a0b05f7488182b54188e4dbcd0d3d0ddf0422d627fa50108cfd80","observation_id":"d2920b16-2a6f-4d31-834b-3fb5bdefb8ad","resolution":{"observed_at":"2026-08-07T11:55:24.307374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.216194Z","title":"What happens to BERT embeddings during fine-tuning?","venue":null,"work_id":"6f65a163-cb54-433e-8740-c5f11664b8e9","year":2020},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.505144Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:7429389d84fc08dc043a88f65dcf63c825155a0c7dd1d9b28597cdf1404934f3","observation_id":"ac83e39d-75aa-4ef6-97c7-80cb5b2c59e5","resolution":{"observed_at":"2026-08-07T11:55:24.243320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.148973Z","title":"How transfer learning im- pacts linguistic knowledge in deep NLP models?","venue":null,"work_id":"a72cfd14-d635-4d1e-9f6b-90f5d2902b6f","year":2021},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.630694Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:86013511425d4e2baf0d9cc44dba0596c5e1fa06202ab590949d9dfaaf0f8ed6","observation_id":"6090745c-e516-4c2b-a6e9-453992f95786","resolution":{"observed_at":"2026-08-07T11:55:24.176512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.097082Z","title":"Can llms facilitate interpreta- tion of pre-trained language models?","venue":null,"work_id":"a623239f-1948-4f1e-beec-008d92893d42","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.750648Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:9978496980899bfd1491f773b01c6f79c8a1488c661f6012e2a42fac7b69803f","observation_id":"d3dc4dd2-ab98-4647-bcd3-5cfae5b2c37f","resolution":{"observed_at":"2026-08-07T11:55:24.122555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:24.045691Z","title":"BERT rediscovers the classical NLP pipeline,","venue":null,"work_id":"265804a9-fdcc-47f7-a74d-b571b77012a1","year":2019},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.859577Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:639b873da0abb4c9c18848790fbcc93d5159afa5dc2b5b1bd6b6a092c94c1143","observation_id":"f5b409b9-6284-47d6-b3d6-878277338d5f","resolution":{"observed_at":"2026-08-07T11:55:24.070758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.986160Z","title":"What does BERT learn about the structure of language?","venue":null,"work_id":"5a7b906f-9d79-40d7-aa7b-accd3ca47aa4","year":2019},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:22.985895Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:c1db04a6e4a0af402cf3937607a7775bbfe9e9c28807bcb6d3933b7eeb1e8e30","observation_id":"a65b4149-1d0c-4d98-9efe-7f5f18e107ab","resolution":{"observed_at":"2026-08-07T11:55:24.011714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.960999Z","title":"Analyzing encoded concepts in transformer language models,","venue":null,"work_id":"4281a4fa-e9b1-46b1-8e34-7452ee833858","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.128424Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:ea249e1bda3ab2e141199ed604f2067dd8c18e3ff6b605826056bad1ebc43709","observation_id":"73408024-63ad-495f-8261-0888a46c1b69","resolution":{"observed_at":"2026-08-07T11:55:23.972262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.940367Z","title":"On the transforma- tion of latent space in fine-tuned nlp models,","venue":null,"work_id":"ceec7d4d-f0b8-4636-8859-6cac20e1b2e3","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.299027Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:69a464c349add0568d86b76d11eead4e4fd9d0629ed42f4da74373ac903fb042","observation_id":"3356eaba-96e3-4302-bdae-defe96c35ce3","resolution":{"observed_at":"2026-08-07T11:55:23.949963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.917760Z","title":"What do end-to- end speech models learn about speaker, language and channel information? a layer-wise and neuron-level analysis,","venue":null,"work_id":"5b393b1d-a47c-4217-8b45-4d58a32af810","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.462634Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:d2ef6f9a07c2d91c61c5e600c97c9938ab766051579f384d51a76f9a4f8f4b01","observation_id":"0d17e645-988c-4a2c-a0e5-06eb3ed94018","resolution":{"observed_at":"2026-08-07T11:55:23.925647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12948","last_updated":"2024-10-16T18:34:07Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-16T18:34:07Z","title":"What Do Speech Foundation Models Not Learn About Speech?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12948","snapshot_observed_at":"2026-08-07T11:55:23.570722Z","title":"What do speech foundation models not learn about speech?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.570722Z"},"links":{"cited_paper":"/paper/2410.12948","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:209dc88d9be85e704dfdf113016552bea3627560af08d84003f7caa09b23e9e4","observation_id":"40d3f00f-dc15-40de-ae50-6e4e6fbd9f3a","resolution":{"observed_at":"2026-08-07T11:55:23.570722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.898453Z","title":"Speech representation analysis based on inter-and intra-model similarities,","venue":null,"work_id":"baab08a1-f5a3-4f3f-be6b-bcad54518689","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.604673Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:205152dcc5bf4344561eb759e66a96a6812ba94b4a0c7ab3a2eefec5aa8b9af8","observation_id":"34c39925-c4be-49bc-8347-d83e20ee6de7","resolution":{"observed_at":"2026-08-07T11:55:23.905500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17666","last_updated":"2025-02-20T18:04:45Z","snapshot_observed_at":"2026-07-06T19:57:28.746485Z","submitted_at":"2024-11-26T18:29:11Z","title":"How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations","version":2},"cited_work":{"arxiv_id":"2411.17666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17666","snapshot_observed_at":"2026-08-07T11:55:23.703385Z","title":"How do Multimodal Foundation Models Encode Text and Speech? An Analysis of Cross-Lingual and Cross-Modal Representations","venue":"cs.CL","work_id":"4131d4a3-99a0-4765-aa62-ee1c0b92e53c","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.610131Z"},"links":{"cited_paper":"/paper/2411.17666","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:858aef935d0314cb07e9756522bbae078b47e5058b74090bea33021171b1f656","observation_id":"e58d2662-778b-4273-8f04-8fe485227484","resolution":{"observed_at":"2026-08-07T11:55:23.714795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.877062Z","title":"Human-like linguistic biases in neural speech models: Phonetic categorization and phonotactic constraints in wav2vec2. 0,","venue":null,"work_id":"ff36d0c1-0626-41d3-bd2c-3dda2508348f","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.615950Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:4a0c7186d45dbacd42e0e54a70577650e3ed5d312751a4f6dd5872bed4df9c40","observation_id":"9df1dfe6-f19e-459b-bb87-64ea8f1580c0","resolution":{"observed_at":"2026-08-07T11:55:23.885809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.856122Z","title":"Probing self- supervised speech models for phonetic and phonemic informa- tion: A case study in aspiration,","venue":null,"work_id":"26cf167d-20dd-46d8-9864-7d4119dcadf7","year":2023},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.622252Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:6f03ff1cc70d75048b6250086f2de98b82d5eb4a58a30f721751081b57907fe4","observation_id":"37ba5095-d0ca-4102-970f-e089cc26f7a4","resolution":{"observed_at":"2026-08-07T11:55:23.864140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.837919Z","title":"SD-HuBERT: Sentence-level self-distillation in- duces syllabic organization in hubert,","venue":null,"work_id":"c3e2496c-d86c-43db-8218-edae7e667ac1","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.628319Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:bcf0be49fa9f02f2b66457c03c4b47c1607d2a45a1cbaad82f0ef190cd595277","observation_id":"32d511d8-d2e6-4675-82d4-02a10a2f1c09","resolution":{"observed_at":"2026-08-07T11:55:23.846073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.820394Z","title":"Phonetic analysis of self- supervised representations of english speech,","venue":null,"work_id":"df7ec56a-11ea-48fa-87ec-aadc1119784a","year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.635644Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:f93a96360bcdc1196ccc84d2a3d49424ccdf51888d202a2f14cc08fdc2ec13ff","observation_id":"38591ffb-30bf-4189-9955-b7b6a7490ecf","resolution":{"observed_at":"2026-08-07T11:55:23.826922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08619","last_updated":"2024-06-12T20:04:44Z","snapshot_observed_at":"2026-08-05T11:23:51.812806Z","submitted_at":"2024-06-12T20:04:44Z","title":"Self-Supervised Speech Representations are More Phonetic than Semantic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08619","snapshot_observed_at":"2026-08-07T11:55:23.641312Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.641312Z"},"links":{"cited_paper":"/paper/2406.08619","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:781f1e70175ca9896b7d40879b78cb3d06ed728d990823bc96e5c009aa3c40b2","observation_id":"1bf89544-a4f6-4900-a853-94601fe19a48","resolution":{"observed_at":"2026-08-07T11:55:23.641312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:23.801955Z","title":"What do self- supervised speech models know about words?","venue":null,"work_id":"30210a05-b39c-48b3-8bba-c105bc5ff62c","year":2024},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:23.650061Z"},"links":{"citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:7bdbec2db5d4a0a42fcd3fb8c231b7a21b210203f63e4a4bebcef189087576be","observation_id":"356262e0-6cb6-4e78-a682-b65595758218","resolution":{"observed_at":"2026-08-07T11:55:23.809257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2506.01133."}