{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73c98c93dbe94493be2174c79f2d480e3ac9ea7e6a05345a8c6262d953ead8b3","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:18.773662Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:15.642048Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:13:15.097149Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14445","snapshot_observed_at":"2026-08-07T00:23:15.642048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:15.642048Z"},"links":{"cited_paper":"/paper/2506.14445","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:4f1ad54c10f654d47337bd4230b094c1620c7193431169151650ca13e68c32ef","observation_id":"92d2b08f-0ae8-4e2a-a849-14f74b4de845","resolution":{"observed_at":"2026-08-07T00:23:15.642048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":"2506.14445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14445","snapshot_observed_at":"2026-06-29T08:13:15.097149Z","title":null,"venue":null,"work_id":"51fd733c-4cea-407a-93cd-f8ecc3c77509","year":2025},"citing_paper":{"arxiv_id":"2605.30027","last_updated":"2026-05-28T14:50:53Z","snapshot_observed_at":"2026-08-06T11:47:39.586448Z","submitted_at":"2026-05-28T14:50:53Z","title":"DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T08:09:41.068000Z"},"links":{"cited_paper":"/paper/2506.14445","citing_paper":"/paper/2605.30027"},"observation_digest":"sha256:bb74a8f4f79357a67129e1cf666b1c272bd573f9eabd84b348a6ea1877dea3f1","observation_id":"521088c5-f028-49b5-a8b3-64f85fbcaaa5","resolution":{"observed_at":"2026-06-29T08:13:15.098727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14445/citation-record","integrity":"/paper/2506.14445/integrity","json":"/paper/2506.14445/citation-record.json","paper":"/paper/2506.14445"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14445","snapshot_observed_at":"2026-08-07T00:23:15.642048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:15.642048Z"},"links":{"cited_paper":"/paper/2506.14445","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:4f1ad54c10f654d47337bd4230b094c1620c7193431169151650ca13e68c32ef","observation_id":"92d2b08f-0ae8-4e2a-a849-14f74b4de845","resolution":{"observed_at":"2026-08-07T00:23:15.642048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.864781Z","title":null,"venue":null,"work_id":"9a660c17-136a-48b4-9bc9-f6600bb961e7","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:15.734690Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:c0ed495dd62cc338f5dbcb4702de0a8d2101f34debdf513399df13f151f10216","observation_id":"0d7d56aa-8fac-4490-b5b9-b7fe1844e710","resolution":{"observed_at":"2026-08-07T00:23:19.872287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.843746Z","title":null,"venue":null,"work_id":"b3aebfda-5174-4735-a8e2-dd5dbb94cedb","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:15.849949Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:43ba8672167ba27d91fb3c128e32205390bfd3bd030b0993b53444da1fd04bfb","observation_id":"6de713e2-bfdf-48a2-bedc-8b0e509dd27e","resolution":{"observed_at":"2026-08-07T00:23:19.849966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.807704Z","title":"(1) In thetrainingstage, by unifying multimodal representations into the same embedding space, Vela improves multimodal embeddings usingonly contrastive learning on text pairs","venue":null,"work_id":"ab410dea-c1bb-4a89-b244-c2f687974bc7","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:15.952336Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:01683624a073d1f1c48bcc7ef97253fd1d03fd9440d9bc5e764802edd3eaab76","observation_id":"a587ad28-d860-45e0-a8c9-83d37b4d677f","resolution":{"observed_at":"2026-08-07T00:23:19.827814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.783881Z","title":"in one word","venue":null,"work_id":"268b23ac-2042-4d8f-9a13-801b5c4150d2","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.044484Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:19c07175f2841f6960e8eafc3e8bb7179097a9a94ee45d03f7ca06e3b09d9ff4","observation_id":"36072b47-8846-45f2-b5f4-cc95fe952309","resolution":{"observed_at":"2026-08-07T00:23:19.790304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.753982Z","title":"Datasets For the training data, we use NLI [18], which contains approx- imately 273k sentence pairs","venue":null,"work_id":"6846a974-efc7-4f75-8c85-c4a368c1363b","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.123834Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:e7ecfce4db15b8854949b2199efbc60dfef79470ed84bd2b791aa4e6781df858","observation_id":"cbb6639b-791e-494a-bc7f-299299a3f86e","resolution":{"observed_at":"2026-08-07T00:23:19.766028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.721313Z","title":"in one word","venue":null,"work_id":"2ced07e1-bac8-48e5-a5fb-6128d07a41ef","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.218939Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:df2f2756e954d29a0011decc45e44a5244c730c442b958a3aee37440ec2dea20","observation_id":"133ae229-6bb5-4a42-b85a-323034cf5a79","resolution":{"observed_at":"2026-08-07T00:23:19.727739Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.681348Z","title":null,"venue":null,"work_id":"cfe28840-2e3f-445a-8123-d038c6683388","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.303912Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:76e192373942c389c5ba56de06ee5fcb059d7ab9367b5797948479aa8ef0dae8","observation_id":"58f87e0e-9792-458c-b02e-1d7cd375e1a1","resolution":{"observed_at":"2026-08-07T00:23:19.688912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.650271Z","title":"Pioneer” and “Lead- ing Goose","venue":null,"work_id":"0831214b-2484-4c3a-bcd7-deef6df342df","year":null},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.433958Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:c7b557eda794747bb8f633c12cbec88b640ee950227209189437a49120863d45","observation_id":"6076796a-ac42-411b-95aa-81896bc425c8","resolution":{"observed_at":"2026-08-07T00:23:19.659669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-10T11:18:27.309853Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T00:23:16.501373Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.501373Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:6bb35c450d6ad2023cab66f2d01c4cb7b07fabdfc1cb0e03489250b0145290cc","observation_id":"56e5fd14-df51-4958-83a5-9fbf72c1ac10","resolution":{"observed_at":"2026-08-07T00:23:16.501373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.611673Z","title":"Large-scale contrastive language-audio pretrain- ing with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"18e75aa9-5182-4f62-89bd-11ea003bb653","year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.593799Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:7be8cf50bfc43fb9360707ea704d07b4424e69ed7a5fc2376f7fbdf9c13ef476","observation_id":"8861ca3d-b434-43fd-9a37-004cdc0e5959","resolution":{"observed_at":"2026-08-07T00:23:19.620030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.581760Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"4407ba8d-2ded-493b-a578-93b33a229f66","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.724661Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:23981b9fd6e2a3ebf2d84d46b1472e88b297511367064dbad837067e59aeee70","observation_id":"63575974-ea51-4c1e-b2d0-1f91f3a867ce","resolution":{"observed_at":"2026-08-07T00:23:19.588446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-07-06T19:58:22.387205Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"cited_work":{"arxiv_id":"2411.18953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18953","snapshot_observed_at":"2026-08-07T00:23:19.246908Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","venue":"eess.AS","work_id":"0fed9bee-d6f1-498a-be0d-6fe82dafded4","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.841565Z"},"links":{"cited_paper":"/paper/2411.18953","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:ff1eca521200dbf904e244362ecbead878413a98e1c2407a040a9bd9b5c65bfb","observation_id":"d4795b6c-b14e-4649-ba61-c559c05a85d5","resolution":{"observed_at":"2026-08-07T00:23:19.253506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.559586Z","title":"Auto-acd: A large-scale dataset for audio-language representation learning,","venue":null,"work_id":"89efa1fb-da01-4139-8d8c-bc69a3a3741c","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:16.970134Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:a7962003f85c29a561c9f5c5620fea997ce5263061b029649813a8ece13810e1","observation_id":"e0db3dfc-e0cf-46ae-90ce-2fd5d84c5395","resolution":{"observed_at":"2026-08-07T00:23:19.566004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.534288Z","title":"Grounding language models for visual entity recog- nition,","venue":null,"work_id":"73b196a2-ab7f-4418-89a6-23fbe257e663","year":2025},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.108875Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:33c0b5d63c0a989874a86ebdef7cf23dd84b1ddc04872ae30a33189043920872","observation_id":"ae836ea5-c0ba-4d47-ae03-83dd62965443","resolution":{"observed_at":"2026-08-07T00:23:19.540632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.509043Z","title":"Improving clip training with language rewrites,","venue":null,"work_id":"1b6a9888-9028-4386-9ee5-e3fc92de7543","year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.191597Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:35957fb45ef3348aaac981ca700c0e764db74e30bc99b24b2c9a3ca69226d6f3","observation_id":"44f06b76-705b-4f28-87f0-59fca8532628","resolution":{"observed_at":"2026-08-07T00:23:19.516980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09541","last_updated":"2024-06-26T14:10:00Z","snapshot_observed_at":"2026-08-04T20:38:38.323109Z","submitted_at":"2024-06-26T14:10:00Z","title":"MATE: Meet At The Embedding -- Connecting Images with Long Texts","version":1},"cited_work":{"arxiv_id":"2407.09541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.09541","snapshot_observed_at":"2026-08-07T00:23:19.204281Z","title":"MATE: Meet At The Embedding -- Connecting Images with Long Texts","venue":"cs.CL","work_id":"d64ea5d8-b457-4838-805b-442c9505948a","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.240558Z"},"links":{"cited_paper":"/paper/2407.09541","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:cee5d7bc16a3cd7606e8c006cd1760081145b6771a54949061ddd38b005b3876","observation_id":"170d5e1b-d45d-4bd5-b171-84c2eb50ed2b","resolution":{"observed_at":"2026-08-07T00:23:19.214601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T00:23:17.301298Z","title":"Metamorph: Multimodal un- derstanding and generation via instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.301298Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:c77c1f73f069b89b3cedcf30cd78f5508f9b6737415c7ba2d3ad079536093bdb","observation_id":"6490dd53-93a4-4064-b166-ea18c5020fc0","resolution":{"observed_at":"2026-08-07T00:23:17.301298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-07T00:23:17.368291Z","title":"Its not a modality gap: Characterizing and addressing the contrastive gap,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.368291Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:4f0cbd63d304ab4d8b30bf8ed9a80ee6a700fa4239486950a06d7aa3559e097d","observation_id":"f55daae4-eb1e-4855-b42d-edbaa6ebe0d3","resolution":{"observed_at":"2026-08-07T00:23:17.368291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T00:23:17.464515Z","title":"E5-v: Universal embed- dings with multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.464515Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:d7bd17ab67d7b552bb74aadacf12629bdb865e93fe676962ee7b7143f9670cc7","observation_id":"01cbf8ab-f77c-469a-b7aa-740d2e687b6a","resolution":{"observed_at":"2026-08-07T00:23:17.464515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:17.617017Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.617017Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:694481e611658ed3fd4642479e1d3e61270cbcc39d1ff6b2af13dfeb7d643954","observation_id":"5b4ba41e-5177-4dae-9255-b868ae0bb404","resolution":{"observed_at":"2026-08-07T00:23:17.617017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.470014Z","title":"Mind the gap: Understanding the modality gap in multi-modal con- trastive representation learning,","venue":null,"work_id":"e153578f-6a39-4d3a-bc2e-c82e6c314688","year":2022},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.715571Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:400b9d9808ae9fe56ab6d5eaf23c35f8a3b5181b4a04c809c5b2c91ee9813b24","observation_id":"0f15b79a-3f1c-400c-9acc-0ca07c27cef8","resolution":{"observed_at":"2026-08-07T00:23:19.475811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04339","last_updated":"2021-06-09T14:32:12Z","snapshot_observed_at":"2026-07-06T11:07:57.831534Z","submitted_at":"2021-05-10T13:13:39Z","title":"DefSent: Sentence Embeddings using Definition Sentences","version":3},"cited_work":{"arxiv_id":"2105.04339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.04339","snapshot_observed_at":"2026-08-07T00:23:19.079705Z","title":"DefSent: Sentence Embeddings using Definition Sentences","venue":"cs.CL","work_id":"80819506-35e4-4e6e-bd03-ede07dadf40d","year":2021},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.848804Z"},"links":{"cited_paper":"/paper/2105.04339","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:6f80fde4b6480e2e4d2fc8eedc032705695c297b6ddaff5dc38f772ec968f7a9","observation_id":"b30d69b7-e188-43b7-a9ef-617c3899c70a","resolution":{"observed_at":"2026-08-07T00:23:19.089736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:23:17.933544Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.933544Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:76563b86edd1154d5e5030102dbecc0c683c4116417ee49618a5f5314a753a42","observation_id":"9bcfe10a-71cd-4a1b-ad24-1104ed40c164","resolution":{"observed_at":"2026-08-07T00:23:17.933544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:23:17.989473Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.989473Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:3f9bbd1178747305ad1ca4f8beb544b9fe2e3e03f8e90a0721b2f403f5454bda","observation_id":"a2047d02-e3f2-4446-81cb-9199c939b801","resolution":{"observed_at":"2026-08-07T00:23:17.989473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.441870Z","title":"Breaking the length barrier: Llm-enhanced ctr pre- diction in long textual user behaviors,","venue":null,"work_id":"ee772f8d-c047-4f8d-b501-f92ccafce44c","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.114021Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:3e4dbff44670d4dbdbcf663f2c15395f631220904528189314ed7f091b1fd399","observation_id":"d8427953-163d-46a7-909c-1a0335f0905f","resolution":{"observed_at":"2026-08-07T00:23:19.450427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-07T00:23:18.247673Z","title":"Simcse: Simple contrastive learn- ing of sentence embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.247673Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:c8d51ccd4be2dc1759252b1cfd1347da6c5abd3d8772e2e427b53af2cc14309e","observation_id":"9398214e-f5a2-49e6-b4a4-c6df3d59032e","resolution":{"observed_at":"2026-08-07T00:23:18.247673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:18.346676Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.346676Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:de9e463a142c624ac50f294e8f6fc56f9ebaad789f00a10588ca17738fb440d9","observation_id":"2a539ff0-0b44-4f33-989c-e56e5cffcd67","resolution":{"observed_at":"2026-08-07T00:23:18.346676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:18.465156Z","title":"Fsd50k: an open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.465156Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:937e9a432eaba65a763f6fd76d734e01ccec9ca5efdb80a800bbc0c8a0792ce6","observation_id":"380a3921-f767-4491-8122-9e123b36e99a","resolution":{"observed_at":"2026-08-07T00:23:18.465156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.386929Z","title":"Audiocaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":"66faa820-06e6-4e56-bff6-23cd25acdd8b","year":2019},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.565474Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:c145ef954c274c274bda8eb396c3a00b74b28d735d087ca42a6da0fa7e915018","observation_id":"1d21cce4-bdcb-4393-9b1c-4332cefd3df7","resolution":{"observed_at":"2026-08-07T00:23:19.394524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T00:23:18.677734Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.677734Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:58b2568e2f01db26052d77621e521f7fc32ed451ef715c1088adf4ad8af02943","observation_id":"71e4145e-c544-4d9b-8c55-318401a0c01d","resolution":{"observed_at":"2026-08-07T00:23:18.677734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T00:23:18.744126Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.744126Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:7c65850e07d67245f7fc4c7a82f52095cf052fb345283875b8bedda6c92f8846","observation_id":"825f3886-9ccf-4810-a33d-33846519efae","resolution":{"observed_at":"2026-08-07T00:23:18.744126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:18.754048Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.754048Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:e4095cd1a4ee77b24072065835ea4605d693ee67d39cad172d910caa4e836557","observation_id":"6bf11e42-7a0b-4500-8708-691084e9f4e8","resolution":{"observed_at":"2026-08-07T00:23:18.754048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:19.338141Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":"3db83ea5-3f95-4cff-b3d5-4da129a2e293","year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.765749Z"},"links":{"citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:e1e76c5aa820102331fce699b8d1dcf0dc7c984b589918a0419357af635c45b1","observation_id":"eb102d5b-958d-461e-b25e-492a2fa22f31","resolution":{"observed_at":"2026-08-07T00:23:19.344994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14851","last_updated":"2025-03-04T08:38:34Z","snapshot_observed_at":"2026-07-06T18:04:13.083818Z","submitted_at":"2024-04-23T09:05:37Z","title":"From Matching to Generation: A Survey on Generative Information Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14851","snapshot_observed_at":"2026-08-07T00:23:18.773662Z","title":"From matching to generation: A survey on generative informa- tion retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.773662Z"},"links":{"cited_paper":"/paper/2404.14851","citing_paper":"/paper/2506.14445"},"observation_digest":"sha256:ce9c99ecea9c4b16cf3bc5d34efc97167ce5f9a6f9f6722147bd95fe4efdc60d","observation_id":"6a298787-e643-4b26-9dbb-44ad3a01906d","resolution":{"observed_at":"2026-08-07T00:23:18.773662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14445","last_updated":"2025-06-17T12:10:19Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T00:15:30.364862Z","submitted_at":"2025-06-17T12:10:19Z","title":"Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2506.14445."}