{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45c9016fb42387f6aa54bc3536b07dd00b612133e3099b5d91b329f5013d6369","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:15.094780Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:53.551896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:41:14.663492Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14562","snapshot_observed_at":"2026-08-07T05:49:53.551896Z","title":"Representation learning for semantic alignment of language, audio, and visual modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.551896Z"},"links":{"cited_paper":"/paper/2505.14562","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:097c7e60dad49e6f7eff44229a8c49601095c38d129f5c90b4aaf3e9be6c32e3","observation_id":"367aff17-6b04-4fb6-9b8f-f32f317f4eed","resolution":{"observed_at":"2026-08-07T05:49:53.551896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"cited_work":{"arxiv_id":"2505.14562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14562","snapshot_observed_at":"2026-08-06T22:41:14.663492Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","venue":"cs.SD","work_id":"62c94015-01e2-4e1f-a6fd-35808f87e957","year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.839628Z"},"links":{"cited_paper":"/paper/2505.14562","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:714c30a68e8d70ddc75a8255139a7816a78641a6c9fd1bd5af58055e70241f5a","observation_id":"3301051a-947f-4ff9-90c4-2bd38cb9021d","resolution":{"observed_at":"2026-08-06T22:41:14.716289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14562/citation-record","integrity":"/paper/2505.14562/integrity","json":"/paper/2505.14562/citation-record.json","paper":"/paper/2505.14562"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.475093Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"005a92c9-dfe5-4e36-b5ed-f4e2b91d8b7a","year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.452064Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:bdae58c1af5a5180fc862740875c28cdfd18515046bfb742d68151f36015abb8","observation_id":"99e7f0db-e75a-41eb-b099-380885e3ee43","resolution":{"observed_at":"2026-08-07T15:36:17.549401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.304957Z","title":"CLAP learning audio concepts from natural lan- guage supervision,","venue":null,"work_id":"226ce8aa-465d-4cc5-8c4e-ed999cce6dd3","year":2023},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.496702Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:57a691fcbca150f0ec66044911391d1db3a96988cc6a2b42d4e42dbf786a627b","observation_id":"2b93de3d-88e2-43dd-a87b-ba987bbb8709","resolution":{"observed_at":"2026-08-07T15:36:17.408674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.160224Z","title":"Multimodal learn- ing with deep boltzmann machines,","venue":null,"work_id":"ea9c63ad-e5ff-4e46-a552-0590c252cc06","year":2012},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.595143Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:a95cc094580e1420ad6371a078d1418d0995d92b466b89a3f57ba0ba7007e4c1","observation_id":"fabf8d23-e5c5-46de-8acd-fa912c52bd6b","resolution":{"observed_at":"2026-08-07T15:36:17.235540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:17.008998Z","title":"Learning visual features from large weakly supervised data,","venue":null,"work_id":"ec380082-4442-488f-9395-f58bd8df1ebc","year":2016},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.679426Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:155d700f9b7f617d3ef7ef6ebec35ba9bfd5bd69e490af26529900bf12487b60","observation_id":"e96eb8f0-4007-4a5a-aa42-9441bc759fe2","resolution":{"observed_at":"2026-08-07T15:36:17.052093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.839551Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":"80a300e2-304b-450f-bc93-10335fb2a7e5","year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.759296Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:add837bb385dc6b4525214274e9c35a77ce69bd29e09c3788182e4232ee9b70f","observation_id":"db6b673f-9dbc-45ab-9532-31d92af84d9d","resolution":{"observed_at":"2026-08-07T15:36:16.912027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T15:36:13.877031Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.877031Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:b39ba9bc1f8031257ca1283a6582257d9cf0ca740df4c235c7bb1ee279cc4b07","observation_id":"32e3baa8-88bc-4130-b9d7-aaa8079621cf","resolution":{"observed_at":"2026-08-07T15:36:13.877031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.700254Z","title":"Wav2CLIP: Learning robust audio representa- tions from CLIP,","venue":null,"work_id":"66ffebf9-a9eb-45cb-85b2-1bfaf8266105","year":2022},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:13.958279Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:2fbd15a78a4e6db8a816d8f9cf48791faf5a74d29de47ba2508c9454763aa688","observation_id":"bb57bd20-a237-4aa2-84a2-75e9ed2c7cdd","resolution":{"observed_at":"2026-08-07T15:36:16.768700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.543114Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"97879f48-ca9f-454a-b3b1-1773653c822d","year":2014},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.079730Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:a69860356680f1d5d07d878bee839cc50d32c3987d2ac2d3e526f213be67435a","observation_id":"396192f0-8fa6-4f63-a623-313544346d70","resolution":{"observed_at":"2026-08-07T15:36:16.591992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.362271Z","title":"Visual genome: Connecting lan- guage and vision using crowdsourced dense image annotations,","venue":null,"work_id":"8d8b4765-1db0-462f-9658-6a97bb6d6181","year":2017},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.223807Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:9c5efcc52545501eecb0068e01076cda2ae7509d94eacfcd290d576a5eacdeec","observation_id":"64a99d06-0983-431a-90d9-1fd6fb60e89d","resolution":{"observed_at":"2026-08-07T15:36:16.430857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.184447Z","title":"YFCC100M: The new data in multimedia research,","venue":null,"work_id":"34b66d02-4f70-4791-85df-2dae7939773a","year":2016},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.325160Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:7b6403a1bd539dc5d9d3ee9f0aebbd70ea2d5f27442fff189980cc64f35e4829","observation_id":"07f760c5-d9c6-4ada-86c1-3a2436579f30","resolution":{"observed_at":"2026-08-07T15:36:16.243583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:16.032935Z","title":"FSD50K: An open dataset of human-labeled sound events,","venue":null,"work_id":"a1e060be-87a7-4745-b854-61a024106ea7","year":2022},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.486000Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:6223232b243ddd8a314f0cbf6b7d25c1b1060be20c55d2cf8b57535acdee14ac","observation_id":"9f471ed8-3cb0-4790-a9ae-65f3e2d60f93","resolution":{"observed_at":"2026-08-07T15:36:16.106720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.886880Z","title":"Clotho: An audio captioning dataset,","venue":null,"work_id":"dd4d887d-e4f2-49c1-ba64-9c9f47ccdcfc","year":2020},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.547487Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:671a73263253c9f5295622277e5d937c34851ffcb59527e48d673dad9db148bd","observation_id":"68537183-119f-44b4-955e-a282dceffadf","resolution":{"observed_at":"2026-08-07T15:36:15.929498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.744690Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"6df2726d-16ea-4a20-aea7-c2b8294e23e2","year":2019},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.665385Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:123469ee1d14a69d83a24b8f6e88f802841a07ef56c8e6288ac7326a5ef3b33b","observation_id":"67bd587a-e2c3-4fa3-9363-a1501bb6a625","resolution":{"observed_at":"2026-08-07T15:36:15.814031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.569281Z","title":"What is the ground truth? reliability of multi-annotator data for audio tag- ging,","venue":null,"work_id":"802e68f7-a225-489b-920c-73843cb181be","year":2021},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.761764Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:c6dfa43a6d84c76e09021b21b782bf464f1d114a7d37d8509652aadcd536db23","observation_id":"0aeba42d-176e-414e-9584-807e916a9439","resolution":{"observed_at":"2026-08-07T15:36:15.632294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.444111Z","title":"Audio- CLIP: Extending CLIP to image, text and audio,","venue":null,"work_id":"51cab54b-9633-428c-be8c-d45821c4f363","year":2022},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.816806Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:7c33769e99a51688b27654107f90076b04247befe6deac74531aff3c64f00f63","observation_id":"d814e34b-9f97-4733-98df-56ee70e7696b","resolution":{"observed_at":"2026-08-07T15:36:15.484053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:15.287479Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"341646ab-ac74-4031-9476-1d69ee0dfa51","year":2017},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:14.933049Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:ff3a46b54bdfeb54f8d9e1dfc4d5da038b42052a71ee96e4e4430b1d249fbb8b","observation_id":"2ece6d4f-4a63-40ea-a543-ceba1cabcdaf","resolution":{"observed_at":"2026-08-07T15:36:15.380850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.14536325","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Sudarsanam, I","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"ad0ea718-cbf1-4c3c-8fec-08a3db0e38ad","year":2024},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:15.021689Z"},"links":{"citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:ef576b98812eec6adc7a044cf87e3903acc7085cf9b99e6ecaa62292f49370a2","observation_id":"3dbc9405-fb1f-4ae3-a221-602119900054","resolution":{"observed_at":"2026-08-07T15:36:15.236385Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T15:36:15.094780Z","title":"Representa- tion learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:15.094780Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.14562"},"observation_digest":"sha256:773d9869d040448bf9bfe4dc6533508155c5ba9cb196b36cbc93612a4c5ead98","observation_id":"7a0b3938-31fc-49ce-ae4f-2a5ff4c5c74e","resolution":{"observed_at":"2026-08-07T15:36:15.094780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 2 inbound Pith citation observations for arXiv:2505.14562."}