{"as_of":"2026-08-10T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3ad4e05ca6f9b37daa9627dca87412d413eb7ae5cd9eee74883564b2eb6d43a","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:54:16.523708Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:12:30.704449Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T03:49:09.587857Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"cited_work":{"arxiv_id":"2506.09375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09375","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Colmbo: Speaker language model for descriptive profiling","venue":null,"work_id":"be621c9b-6e86-4aa9-8fb8-bac2398d5612","year":2025},"citing_paper":{"arxiv_id":"2605.15044","last_updated":"2026-05-14T16:36:57Z","snapshot_observed_at":"2026-08-06T09:10:03.624671Z","submitted_at":"2026-05-14T16:36:57Z","title":"SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T03:20:37.488507Z"},"links":{"cited_paper":"/paper/2506.09375","citing_paper":"/paper/2605.15044"},"observation_digest":"sha256:4e1ffaa1f01a5f2caa78e0374eeb013df27b930355dadcfb9de1b09ceea86646","observation_id":"d2701b38-547c-4780-ad59-9e18bda8fe7e","resolution":{"observed_at":"2026-05-15T03:24:55.781236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09375","snapshot_observed_at":"2026-08-02T01:12:30.704449Z","title":"Colmbo: Speaker language model for descriptive profiling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14753","last_updated":"2026-07-16T09:38:45Z","snapshot_observed_at":"2026-08-08T00:38:13.414993Z","submitted_at":"2026-07-16T09:38:45Z","title":"Large Audio Language Models for Spoofing-Aware Speaker Verification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:12:30.704449Z"},"links":{"cited_paper":"/paper/2506.09375","citing_paper":"/paper/2607.14753"},"observation_digest":"sha256:d9f77b55b86afa6ad2c7dab3b043a901a07cef025e79ee745e3911f59f7dce2a","observation_id":"00bc2fc1-edc9-4bd5-87d5-2f6625cd7dfb","resolution":{"observed_at":"2026-08-02T01:12:30.704449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09375/citation-record","integrity":"/paper/2506.09375/integrity","json":"/paper/2506.09375/citation-record.json","paper":"/paper/2506.09375"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:21.935118Z","title":"Singh, Profiling humans from their voice","venue":null,"work_id":"ef1b7072-9d3f-458f-a355-916a09cd8fc5","year":2019},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:12.573959Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:5844798d0d25e79853178659135a9025c867d49bfad21200f072aea0975131b4","observation_id":"1e55df75-f254-4d7d-b201-a4b37b63cfd7","resolution":{"observed_at":"2026-08-07T04:54:22.083119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00887","last_updated":"2024-03-01T11:28:37Z","snapshot_observed_at":"2026-07-06T17:38:22.080507Z","submitted_at":"2024-03-01T11:28:37Z","title":"SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech","version":1},"cited_work":{"arxiv_id":"2403.00887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00887","snapshot_observed_at":"2026-08-07T04:54:16.984438Z","title":"SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech","venue":"eess.AS","work_id":"8a0bf36a-a265-41f0-82df-b7d091203cef","year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:12.714022Z"},"links":{"cited_paper":"/paper/2403.00887","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:1f6be22b2c5e954266252ab868f8da91f4e6a814324e8fd8be295d4885ca4f20","observation_id":"52e474f0-1649-4bfb-be8c-8b85b5173e33","resolution":{"observed_at":"2026-08-07T04:54:17.065427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:21.695489Z","title":"Prediction of age from speech features using a multi-layer perceptron model,","venue":null,"work_id":"b384f84f-0d7f-4bbb-8877-88814052b564","year":2020},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:12.829754Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d22f1912dc8ed93862aad82583545f811717363c8cd297955cc1de3c58f8dba1","observation_id":"9a7357ea-5862-4f48-b372-b4e84c051c72","resolution":{"observed_at":"2026-08-07T04:54:21.806777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:21.510815Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"79d1263b-3fbc-41cc-8688-58b8f92a2ef4","year":null},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:12.984271Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:8b35af973331ee438d3531cbaf8dab07087d8ac7df4437a79729eae9a3ad7552","observation_id":"af666c14-a783-4cc7-a266-e9f4a27f04ce","resolution":{"observed_at":"2026-08-07T04:54:21.586191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T04:54:13.128574Z","title":"Qwen-audio: Advancing universal audio under- standing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.128574Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:9de4097e36422cae60fdf77dc04172924e6468ed527a2c055c94b51b1eefca97","observation_id":"622b8839-2497-4a35-b351-39a993fdd582","resolution":{"observed_at":"2026-08-07T04:54:13.128574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:13.257810Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.257810Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:41e6579d85852a956dfcf9267e0ebf60c470ea6ba06bf1380f4e86a759c795e2","observation_id":"a0b56506-e4b4-47cf-9bc8-9d7a2890f29a","resolution":{"observed_at":"2026-08-07T04:54:13.257810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T04:54:13.382210Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.382210Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d306e879083db372f8ec6479144ccb57ca0b05e85462af051b572e38f538d776","observation_id":"ed050362-11eb-4766-9b85-376437709e6e","resolution":{"observed_at":"2026-08-07T04:54:13.382210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T04:54:13.519625Z","title":"Gama: A large audio-language model with advanced audio under- standing and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.519625Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:3c3630bd2b5f93a1da9089baa13506928e3e7317bdcc0c7cef4be4d44706fe82","observation_id":"9c967c50-3543-44f4-b64c-13e5197827fb","resolution":{"observed_at":"2026-08-07T04:54:13.519625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:21.306168Z","title":"Speaker recognition for multi-speaker conversations using x-vectors,","venue":null,"work_id":"a4c22459-ebc2-4b46-83fc-01752f82869a","year":2019},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.637259Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d7e0d185fadeb273d5b7ef0fae5220cac706ff4ade6d5d340b993a992b1788dd","observation_id":"884ca67a-6d6c-43d9-9744-6ac44965e930","resolution":{"observed_at":"2026-08-07T04:54:21.412124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:21.069393Z","title":"Front-end factor analysis for speaker verification,","venue":null,"work_id":"00ed5365-52f6-41b1-a7de-c1f7e59beec9","year":2011},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.770908Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:7d7307b7282a4c32210dd9bcd52b5763cae4eb1a2e9203c70ff83c82e3df4912","observation_id":"714c89ab-903b-47e1-b36d-78d40589ef49","resolution":{"observed_at":"2026-08-07T04:54:21.171886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:20.804346Z","title":"Deep neural networks for small foot- print text-dependent speaker verification,","venue":null,"work_id":"07841206-5253-4152-b5dc-75e9735962bc","year":2014},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.944604Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:3946c9b08bbcb4af5e387d59cbd845a5cdb9ebcd0482f36018e7ee0ec96d0da3","observation_id":"dab474bf-85c3-4fa2-9b32-7ab971586295","resolution":{"observed_at":"2026-08-07T04:54:20.906038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:20.556600Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"b220d9cf-e8fa-456d-b8e4-036ebbc5b4d3","year":2018},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:14.063835Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:9379691200b82b85606e17dbe129368bb527caf603ecbb3350bbb6ecc023ee9f","observation_id":"aa719a45-2e84-40eb-aa1d-c24c9e641d01","resolution":{"observed_at":"2026-08-07T04:54:20.679258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:20.321903Z","title":"Front-end factor analysis for speaker verification,","venue":null,"work_id":"cdf92b06-55f1-4566-ad19-ae2a2d00c9a4","year":2010},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:14.186302Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:20fe6d08ecaf7b88382b9377e62daf09fa7045b10224d5e97abb935908b06ea6","observation_id":"5fe4dcfe-dcb8-4f34-a86c-d954bbd1ba6b","resolution":{"observed_at":"2026-08-07T04:54:20.438171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:20.110484Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"976333cd-abfd-4d80-a350-db1f5d6fd2ee","year":2020},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:14.348254Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:df7c662f50d4f7ebe93cce2990b5eabd3e021712956bfec62311b50d6649ad5b","observation_id":"e84767c0-373c-4828-8add-3905da63afec","resolution":{"observed_at":"2026-08-07T04:54:20.219859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:19.854568Z","title":"Mfa-conformer: Multi-scale feature aggregation conformer for automatic speaker verification,","venue":null,"work_id":"ba9cfcb9-2321-40e6-a7e9-52061749bc68","year":2022},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:14.495507Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:56120c1e3c3fd7a693cc2d87fe32fcf0f339f9e4680edc57dbc1a3825f242589","observation_id":"ad2fb05a-1dbb-4e8c-85cb-d3e9d1612847","resolution":{"observed_at":"2026-08-07T04:54:19.955951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:19.585596Z","title":"A novel scheme for speaker recognition using a phonetically-aware deep neural network,","venue":null,"work_id":"88439039-346f-4e66-b153-dfdf0e44b9fc","year":2014},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:14.692566Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:6b609e1655627af2cf11fedbd95d15df5f6e20839158e068c21074385a4f19ed","observation_id":"48d2153f-20df-4719-96d5-5b086db3dc36","resolution":{"observed_at":"2026-08-07T04:54:19.718881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:19.262241Z","title":"Employing phonetic information in dnn speaker embeddings to improve speaker recognition performance,","venue":null,"work_id":"5eead712-61b6-4fc9-a593-8475070ca2d8","year":2018},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:14.824249Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:74fee87029370a9de168075858af424cfdac63b8b606cf3d7ca68f055690b93f","observation_id":"460728b4-b63d-4ecb-997a-3d05888fbab3","resolution":{"observed_at":"2026-08-07T04:54:19.409779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04862","last_updated":"2018-06-14T13:17:27Z","snapshot_observed_at":"2026-07-06T06:33:15.714029Z","submitted_at":"2018-04-13T09:51:14Z","title":"Speaker Embedding Extraction with Phonetic Information","version":2},"cited_work":{"arxiv_id":"1804.04862","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.04862","snapshot_observed_at":"2026-08-07T04:54:16.710251Z","title":"Speaker Embedding Extraction with Phonetic Information","venue":"cs.SD","work_id":"628a8801-0105-42dd-82f4-00a50181d664","year":2018},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.003832Z"},"links":{"cited_paper":"/paper/1804.04862","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:a457fcefacb4b079f4ce9fcdcd28ccadbbbd96d68963dfac35d370c96d90a18e","observation_id":"b4f9717d-1e1f-4572-bde9-4f699a9d9dab","resolution":{"observed_at":"2026-08-07T04:54:16.793671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:18.951664Z","title":"Gender and age estimation methods based on speech using deep neural networks,","venue":null,"work_id":"6a5fb793-f9f9-4715-9658-a69a2da41b1c","year":2021},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.125576Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:250a8bb43bb6a2e78c7bb0f556e07c99026d8f8939408633ed25f2e617595204","observation_id":"2b5087c3-98b3-4329-bb21-02284159fb25","resolution":{"observed_at":"2026-08-07T04:54:19.123983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19796","last_updated":"2024-05-30T08:04:28Z","snapshot_observed_at":"2026-07-06T18:22:31.384923Z","submitted_at":"2024-05-30T08:04:28Z","title":"Explainable Attribute-Based Speaker Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19796","snapshot_observed_at":"2026-08-07T04:54:15.253430Z","title":"Explainable attribute- based speaker verification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.253430Z"},"links":{"cited_paper":"/paper/2405.19796","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:309ecb10f69fdf6ea6f7d3cba4485e220903ec801ad25f6b211a40abac928172","observation_id":"ebce4b4a-d3d7-43bd-80a4-ba29b5b2052c","resolution":{"observed_at":"2026-08-07T04:54:15.253430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:18.657146Z","title":"Pdaf: A phonetic debiasing attention framework for speaker verification,","venue":null,"work_id":"b59366b4-e3a6-4a4f-9767-9e2b6dd0eceb","year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.419608Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:df3d34289a6b5a65749db38ab941ca42779f2e7e4eff8e9793f1f4d61d50ecff","observation_id":"bce57a1b-a809-4bea-9796-5cb1d0de19fb","resolution":{"observed_at":"2026-08-07T04:54:18.816521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T04:54:15.589604Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.589604Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:3d633b5aff1920b320d6bfb948d9c4143f1509f416483de45ec591dccef2302c","observation_id":"f8c28283-b524-4c6a-bf1d-4adbcaf03595","resolution":{"observed_at":"2026-08-07T04:54:15.589604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:18.367647Z","title":"Multimodal few-shot learning with frozen lan- guage models,","venue":null,"work_id":"cbd428d5-4c4b-4a0d-9b4f-91bbb5ca9ff5","year":2021},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.751445Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:9a1b28ee7c789c92d7d19e0b3cbf18781b4fd69dc91b2e76abdf6ff31104834e","observation_id":"b80c9514-0a64-4ffe-aec1-0c05fd711fa3","resolution":{"observed_at":"2026-08-07T04:54:18.489518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:18.066233Z","title":"EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation,","venue":null,"work_id":"d1f7a0e5-97c7-455a-951d-394f1328d444","year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.862316Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:0a71611cd17e17f9ddceedf45d5988c1e4c080d3c7cf4df57293b0f55ba1433d","observation_id":"5ea11c10-beb9-4c77-9595-8e602a406a51","resolution":{"observed_at":"2026-08-07T04:54:18.202577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:17.765382Z","title":"Darpa timit acoustic-phonetic continuous speech corpus cd-rom. nist speech disc 1-1.1,","venue":null,"work_id":"33ed4165-54a0-456f-9ead-e75e7a131e44","year":1993},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.969339Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d947cbe8b18fe45bd0ed1d5f55327754e097b9a98a51cd2c04986d16f0fe4c57","observation_id":"0ccf614f-994e-4089-8054-e69a8d5e55a5","resolution":{"observed_at":"2026-08-07T04:54:17.892657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:54:16.137326Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:16.137326Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:db5596f10705dbb9a4df5b278fc5e6a12b53b13a7d466e07001552745624ae20","observation_id":"28bb011e-b81e-47b8-a31d-27847cbbbd50","resolution":{"observed_at":"2026-08-07T04:54:16.137326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18062","last_updated":"2024-07-25T14:17:56Z","snapshot_observed_at":"2026-08-09T11:26:54.015185Z","submitted_at":"2024-07-25T14:17:56Z","title":"Audio Entailment: Assessing Deductive Reasoning for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18062","snapshot_observed_at":"2026-08-07T04:54:16.288107Z","title":"Audio entailment: Assessing deductive reasoning for audio understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:16.288107Z"},"links":{"cited_paper":"/paper/2407.18062","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:4a3d6b17896df7e5afbabb4b88ca4442c2f131c7a8c28f79545844efe67b3153","observation_id":"8d60644f-f691-4de9-a987-93d0a1976863","resolution":{"observed_at":"2026-08-07T04:54:16.288107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:17.497348Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"afeddd79-1fc3-4c66-b9b7-bceaa8f8a720","year":2015},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:16.429096Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:d0eda75e20fb11710b2a94b050aab5d7e716d93de95972e0836b77d853221194","observation_id":"b94ec1ce-8733-415f-a8b1-afbc1565e7b0","resolution":{"observed_at":"2026-08-07T04:54:17.641108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:54:17.215313Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":"ba369ea1-c759-4de3-b8d9-d323bacff5eb","year":2019},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:16.523708Z"},"links":{"citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:dd40bc4e664f244af1919eb1c41df56d17451e7cf6d112eeb4a53a19cb856359","observation_id":"3ec8cfe9-c01c-41dd-84db-f67641700744","resolution":{"observed_at":"2026-08-07T04:54:17.336576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 2 inbound Pith citation observations for arXiv:2506.09375."}