{"as_of":"2026-08-17T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa9635fb84e5ccfa8c991a3b05f0d937c45eaefeb3bbe8eb49be74e6f864b899","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:53:44.257683Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:53:39.652813Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:53:44.519215Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"cited_work":{"arxiv_id":"2506.16020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16020","snapshot_observed_at":"2026-08-06T23:53:44.519215Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","venue":"cs.SD","work_id":"88db29d0-49b5-4886-a578-858e3090d372","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.652813Z"},"links":{"cited_paper":"/paper/2506.16020","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:31fae3f7cc7342beefb4c2266f5b8ed6b7ab71d085e6e9e288ae03abedaa199f","observation_id":"ea639187-d110-4431-83f3-880b40a28e15","resolution":{"observed_at":"2026-08-06T23:53:44.614311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16020/citation-record","integrity":"/paper/2506.16020/integrity","json":"/paper/2506.16020/citation-record.json","paper":"/paper/2506.16020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:53.167644Z","title":"As the continuous development of diffusion models [6–12], the naturalness and fluency of syn- thesized singing speech have now approached those of human performances","venue":null,"work_id":"577177e1-7ae1-480e-b0a1-f1d06374c745","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.570507Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:a701f64bab1f5659e9d541408451ecc5dd059d193d67cf185c8fe764ed73f1e8","observation_id":"52b214e2-5f4f-4332-a795-61f44f5b65f1","resolution":{"observed_at":"2026-08-06T23:53:53.294893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.931447Z","title":null,"venue":null,"work_id":"4fec5d11-7915-4ff8-9bb2-92dff9828548","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.747869Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:5730a1686a5fb7e383de4ba3a7683291bb42f4f13739c4903803cd59b9a9f5a7","observation_id":"1e4c4461-0d32-4f73-83e0-d8b00da30345","resolution":{"observed_at":"2026-08-06T23:53:53.052980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.670147Z","title":"test- seen","venue":null,"work_id":"6ccc916b-db27-4f1a-b1e2-c9ded99864a9","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.855427Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:7ae0c7687950a2f5a596b6a5cea028f626af39978b32d57790435fbda0a0d64d","observation_id":"506c1bba-3090-49ed-9ec5-2322f40c60c0","resolution":{"observed_at":"2026-08-06T23:53:52.830799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:51.826843Z","title":"VS-Singer consists of a modal interaction network, a decoder based on consistency Schr ¨odinger bridge and a spatially-aware feature enhancement module","venue":null,"work_id":"dc7b1fa2-ef6c-42fa-a59a-f73620b269a2","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.204764Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:f7b45dbcd0f37654ba00edb0482c820a64a03b2477ad718748400a38970ec322","observation_id":"277be0cc-4485-447a-a6c9-487e60bc5453","resolution":{"observed_at":"2026-08-06T23:53:51.984203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.438605Z","title":null,"venue":null,"work_id":"96f5cd38-68ad-4f04-bc4a-e91c095d8483","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.987942Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:83f6fe471cf01d67ae760b7c216a62d714c99cea0faf9fd227077244e5b60485","observation_id":"ab92c3dd-d228-4d7b-8c13-724f6c3a1018","resolution":{"observed_at":"2026-08-06T23:53:52.547797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:52.118690Z","title":"7) Sep- Stereo [35], a model that converts mono audio to binaural audio using scene images","venue":null,"work_id":"6136e303-dd57-4cba-87da-4fa8d3fa8a83","year":null},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.128440Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:ab3fc2390abc6c95a8ff745e21377f92a38c87cb5b96f8f7a42dd13b5332fb46","observation_id":"d4bddf8b-9472-435b-b305-b47b5ffe890b","resolution":{"observed_at":"2026-08-06T23:53:52.268194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:40.946806Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.946806Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:9b5335201e16dbe939ba3a30a81212d092f24bd92ebf22c46c58a6b240afff18","observation_id":"52f1e380-921e-4605-b131-3406651a4f90","resolution":{"observed_at":"2026-08-06T23:53:40.946806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:51.440945Z","title":"Diffsinger: Singing voice synthesis via shallow diffusion mechanism,","venue":null,"work_id":"048bb385-e3b5-46db-91f5-f60fbaf65f23","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.290437Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:7b5ed1bd6833ec6adeb7777d8d4fa23c58b851d39d9715c930bc64f9779a425c","observation_id":"d0f9af91-738f-4989-9de4-300298b27e02","resolution":{"observed_at":"2026-08-06T23:53:51.637949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.978675Z","title":"Visinger2: High-fidelity end-to-end singing voice synthesis en- hanced by digital signal processing synthesizer,","venue":null,"work_id":"543ec96e-d35b-4cf5-84bc-8968d8ae1d1d","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.400396Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:d321d18785347eead1f3b0a7f6dd60472059ebf29bef6e2fb660534d22027ec0","observation_id":"d98e1918-bcd3-461b-ba9e-42dd8f65eb67","resolution":{"observed_at":"2026-08-06T23:53:51.216181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.814118Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head,","venue":null,"work_id":"82e58522-0765-4a89-9cc2-22ec023edbe7","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.478105Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:4dd79a739237ab5fe7643fec0b1a85e89446da6b544b9644dd183055650ffd64","observation_id":"6020805f-aa77-4bcd-80b9-29d618d53d66","resolution":{"observed_at":"2026-08-06T23:53:50.874815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06307","last_updated":"2024-09-10T08:07:43Z","snapshot_observed_at":"2026-08-16T13:19:50.926603Z","submitted_at":"2024-09-10T08:07:43Z","title":"An End-to-End Approach for Chord-Conditioned Song Generation","version":1},"cited_work":{"arxiv_id":"2409.06307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.06307","snapshot_observed_at":"2026-08-06T23:53:44.395930Z","title":"An End-to-End Approach for Chord-Conditioned Song Generation","venue":"cs.SD","work_id":"a5a968d3-3844-49ab-867d-010d8e79482e","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.561586Z"},"links":{"cited_paper":"/paper/2409.06307","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:c2830103f91aac350869dbd39dcdf64635588bedafd8c6433c520f9a3abf67f3","observation_id":"09c9318b-5542-4054-b79f-2687f059b699","resolution":{"observed_at":"2026-08-06T23:53:44.430171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.674168Z","title":"Unisyn: an end-to-end unified model for text-to-speech and singing voice synthesis,","venue":null,"work_id":"67d630e8-db64-4b4d-bfa6-4851925a2e45","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.663144Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:af5a1de775571558b7065af653cfcf552748acb81efd8b28e739401910b027a1","observation_id":"c088f08b-dec3-49b5-b3b5-ef3c8cc19328","resolution":{"observed_at":"2026-08-06T23:53:50.765455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:40.784747Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:40.784747Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:cd42b1f63a498036e7375bd47ccb1c0135542c1f8b80793152144782829de44d","observation_id":"773e026a-481e-4ded-9e08-7b799704bf1b","resolution":{"observed_at":"2026-08-06T23:53:40.784747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.976473Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":"230e1e5a-d683-41b8-b976-1954f839628f","year":2021},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.697669Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:b2b1b2f0ea5f6ce14f6913897cf7a83e38ed6dc6eea1b468a7e2b625b406991f","observation_id":"f3e481f1-25ae-4764-bc6f-92bfbadd4674","resolution":{"observed_at":"2026-08-06T23:53:49.046653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.430481Z","title":"Learning the beauty in songs: Neural singing voice beautifier,","venue":null,"work_id":"0de85aa1-658f-412f-988f-eccb54642da8","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.075668Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:5da0a5a2f1f5e214dce461ab32c15190650626b1bd484eba0765daa9cce1419f","observation_id":"c524afbb-bf39-4a08-a685-cf7d4cd61a08","resolution":{"observed_at":"2026-08-06T23:53:50.499591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:50.177767Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models,","venue":null,"work_id":"faaa4138-b819-4aaf-aa75-9c56941cf684","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.185792Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:bfec4567535238d14e87762af322309fe2981481b450e9551cd63a6b3923b530","observation_id":"1d54c7ef-8809-4841-9688-b83bfd164986","resolution":{"observed_at":"2026-08-06T23:53:50.317937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.930709Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion,","venue":null,"work_id":"ade03273-bd0e-478d-adf0-30c5953c7580","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.315721Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:c39d9b765173989bab917a31d50a4dd788d483fa68f4b4f6482c2ef2fdbf7dea","observation_id":"99d8ab57-2439-4cf3-a06a-dcfcecd73e90","resolution":{"observed_at":"2026-08-06T23:53:50.033407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.671677Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation,","venue":null,"work_id":"f4cf0992-5a83-42e5-b358-bbb5207029ef","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.409879Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:32ee0607a977b083d18ad4a8b0af883c274c19c6df74d251227a482fb994e4d6","observation_id":"199a1995-ba54-4999-876c-43f6e67dbf4d","resolution":{"observed_at":"2026-08-06T23:53:49.783454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.423473Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":"cb9adbb7-e18a-46e0-8a72-a8798c3af094","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.541143Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:cf955f2a549262a7775d330369c4a311c67cee15a7dec38799a30c4378004183","observation_id":"1f057377-e4ef-48be-9bb6-1bff537e9148","resolution":{"observed_at":"2026-08-06T23:53:49.548243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:49.154131Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":"1cdc8732-3dd6-4c9b-9574-ecc8cf3ba8db","year":2021},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.601848Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:f74a5e8f2e81cbb80678a47ecc5a17876135c7b029986bccc72ff30dca73989b","observation_id":"c9d916d6-6dcf-47b5-962b-70de28f610e6","resolution":{"observed_at":"2026-08-06T23:53:49.292215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.492140Z","title":"Novel-view acoustic synthesis,","venue":null,"work_id":"a9739765-20f1-40a8-a06e-d776553332da","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.602814Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:4722e20037be6989534c0fd947315f335f6771230e010abff237319f284b960d","observation_id":"953b44ab-1be8-41db-a904-2aa718c0b47f","resolution":{"observed_at":"2026-08-06T23:53:47.582153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.780381Z","title":"Como- speech: One-step speech and singing voice synthesis via consis- tency model,","venue":null,"work_id":"bca88b76-814e-4fb8-9592-ffc5c91219bc","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.831441Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:49c74a75aa85729e0238d8ca33ff9904989c9d1b48f65334aaed07a039449bb8","observation_id":"6b7b15d7-71e0-4583-aecd-21ce5fd23faa","resolution":{"observed_at":"2026-08-06T23:53:48.915571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.528652Z","title":"Consistency models,","venue":null,"work_id":"99d0b27e-5936-4a41-8f83-7eaac1935ed4","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:41.994604Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:8ac2aeab50cb5254131b66bb5cab699c9e7dd21905a79667e1d237cce145f908","observation_id":"35035fff-63ed-4215-a90d-49f5ca2bf935","resolution":{"observed_at":"2026-08-06T23:53:48.652424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"cited_work":{"arxiv_id":"2506.16020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16020","snapshot_observed_at":"2026-08-06T23:53:44.519215Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","venue":"cs.SD","work_id":"88db29d0-49b5-4886-a578-858e3090d372","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:39.652813Z"},"links":{"cited_paper":"/paper/2506.16020","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:31fae3f7cc7342beefb4c2266f5b8ed6b7ab71d085e6e9e288ae03abedaa199f","observation_id":"ea639187-d110-4431-83f3-880b40a28e15","resolution":{"observed_at":"2026-08-06T23:53:44.614311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T23:53:42.127548Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.127548Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:60839e992dfc1d95c5ac01a2e58f421ecaa7e9ac71c30c847391e00ea9a9f386","observation_id":"762799b2-c25c-48d3-be60-9f847c2a8a4d","resolution":{"observed_at":"2026-08-06T23:53:42.127548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:48.181161Z","title":"2.5 d visual sound,","venue":null,"work_id":"b30357fa-b856-41a0-9ac9-21e18266ca90","year":2019},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.249129Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:63ca18aa61096523454bac924229d331f428af4431046b4f2824db985111b05c","observation_id":"66992bb6-d77c-48a6-9a8a-0f57d0865c82","resolution":{"observed_at":"2026-08-06T23:53:48.339568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.923032Z","title":"Enhancing spatial audio generation with source separation and channel panning loss,","venue":null,"work_id":"3b5dd369-358e-456e-bff6-7256709b2ff1","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.339805Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:6ec84ccdffa0b699dfad36f6b43839146e2943bd8b55293a5dbe0e1f65d491be","observation_id":"aafe6f73-5b3a-4638-86d2-35aef7133339","resolution":{"observed_at":"2026-08-06T23:53:48.071677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.670325Z","title":"Multi-source spatial knowledge understanding for immersive visual text-to-speech,","venue":null,"work_id":"97f83673-419b-40fc-8884-0b0e03b94f98","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.456963Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:5cea809f3f0688b415877e5a5f3bf7771fe1cab6d722488bee9f7c0d486398d6","observation_id":"6f054485-c628-454a-8b32-7a6c2efb7461","resolution":{"observed_at":"2026-08-06T23:53:47.807211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:47.228803Z","title":"Visually guided binaural audio generation with cross-modal consistency,","venue":null,"work_id":"fe256f6e-c17b-43a9-939b-b1b242b94d44","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.753463Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:94bcb60d23a4ae6e464e6b95a140d7f358e582511ac98dc6064a62c526577915","observation_id":"be610d70-f0ab-47ef-8361-5ed037b37824","resolution":{"observed_at":"2026-08-06T23:53:47.365066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.917991Z","title":"Multi-modal and multi-scale spatial environment understanding for immersive visual text-to-speech,","venue":null,"work_id":"5bbcfe48-f415-4bee-8bf0-40029ea8f836","year":2025},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.846974Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:0071bc1e556041bc8d8556a317ec12b84409ff169c9b03e2f142fb97f2ff85ba","observation_id":"af230ae0-97c4-4739-8772-9a4b993b04f0","resolution":{"observed_at":"2026-08-06T23:53:47.055369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.720178Z","title":"Opencpop: A high-quality open source chinese popu- lar song corpus for singing voice synthesis,","venue":null,"work_id":"4affb1a1-0528-4c2c-bb62-b20279813a52","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:42.944905Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:49f8a973661a94ea5a7645f04f0861efebcf1d5e15685ce39bde185f8b8a8f86","observation_id":"c799f48e-d42e-4be5-9312-64db73ad783a","resolution":{"observed_at":"2026-08-06T23:53:46.792475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:43.052802Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.052802Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:1d4cc07a87d6cbd54866c91c4cb60d8da14408fead906257f92706aed500cdd5","observation_id":"6a410bcf-9fb6-404e-828c-75bea8fa0ee0","resolution":{"observed_at":"2026-08-06T23:53:43.052802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.479552Z","title":"Diffusion schr¨odinger bridge matching,","venue":null,"work_id":"6bfe70bb-14f6-4682-ad93-2b13017561ed","year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.170695Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:448e4ecf26b6dab07c6152c77ff37b18474c996b20c3e5cb60028e69ccf3ecfd","observation_id":"e5c29d9c-fdd8-4f27-b17a-584b1dd191b9","resolution":{"observed_at":"2026-08-06T23:53:46.625428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.302759Z","title":"Likelihood training of schr ¨odinger bridge using forward-backward sdes theory,","venue":null,"work_id":"929a83df-7b9e-4d6d-b66a-0bfad595d5fa","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.271303Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:f2c27111143df74eb547639c99e6649cae26b3ecb66cdcd616db7ece0ec57503","observation_id":"dc9a9d56-171f-4a64-914a-df7ef556c927","resolution":{"observed_at":"2026-08-06T23:53:46.384510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14623","last_updated":"2024-10-29T02:54:10Z","snapshot_observed_at":"2026-08-17T04:13:42.221015Z","submitted_at":"2024-03-21T17:59:41Z","title":"Simplified Diffusion Schr\\\"odinger Bridge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14623","snapshot_observed_at":"2026-08-06T23:53:43.454000Z","title":"Simplified dif- fusion schr\\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.454000Z"},"links":{"cited_paper":"/paper/2403.14623","citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:1b37b031af3a2e97690f5dea52be4c7075ec6d63b3c3d6b05739b3fb2ff79f73","observation_id":"1489dcf6-c11b-40ad-b9d3-f44e0dcf7b08","resolution":{"observed_at":"2026-08-06T23:53:43.454000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:46.086664Z","title":"I 2sb: Image-to-image schr ¨odinger bridge,","venue":null,"work_id":"8750406b-ab68-4c42-8446-f740094ac490","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.577638Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:65fe6e204ee5a4a928eed3f0620a02962c0faeefd9d9992b208df1372b185bdf","observation_id":"4713961d-e9ee-432c-b691-bece85ce1578","resolution":{"observed_at":"2026-08-06T23:53:46.162553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.858205Z","title":"The unreasonable effectiveness of deep features as a perceptual met- ric,","venue":null,"work_id":"b76eedfc-14d9-49a0-bb17-3f14ecaf8732","year":2018},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.667055Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:9d4c845eb6a8ee2f822117a7043ea75ee0172e994cae3cd22676a175466f5f94","observation_id":"6c5ec59b-df2f-4f53-b61d-e06d87539de2","resolution":{"observed_at":"2026-08-06T23:53:45.994718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.666831Z","title":"Visual acoustic matching,","venue":null,"work_id":"4c16389d-1094-4bfd-a523-5e9ca473d12a","year":2022},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.819082Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:8e57b6df7f4173fb95e2de124678e6871b0afb774d97775ba2c0e875b560fd89","observation_id":"69fd5a5a-6235-4337-99af-87d15d8e698a","resolution":{"observed_at":"2026-08-06T23:53:45.754757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.395163Z","title":"Ima- genet: A large-scale hierarchical image database,","venue":null,"work_id":"3eda9f2f-c14e-4777-a8ca-4be7ba23cbc1","year":2009},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:43.931528Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:40be317303cd10e85fa42ca8e5b5746718b7ba4ba29fc9c37a55188a5858b887","observation_id":"82807bfe-5b9f-44c1-a1c7-768225211a68","resolution":{"observed_at":"2026-08-06T23:53:45.514262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:45.199091Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"83a23511-7313-4c67-8351-b5eb89c2c1cf","year":2021},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:44.050995Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:6cc38e9b1d71ff76b75787366e1a1719d9b0f3bc5e2754afa6be76f5ac42008b","observation_id":"1ab969e2-2260-4507-92e2-0b1980acaa83","resolution":{"observed_at":"2026-08-06T23:53:45.249542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:44.958799Z","title":"Self-supervised vi- sual acoustic matching,","venue":null,"work_id":"49f31148-1fe5-410f-9c76-d49c45c3d0db","year":2023},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:44.171093Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:563060e70c55470261df52d80a68d620c740b51fec32dab0cbe6e6a900f8aae7","observation_id":"2e876622-dc92-42a8-bd94-09c3e13b7a74","resolution":{"observed_at":"2026-08-06T23:53:45.071008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:44.761718Z","title":"Sep-stereo: Visu- ally guided stereophonic audio generation by associating source separation,","venue":null,"work_id":"a0c52b77-e6e6-4a16-a635-a5542b1eea54","year":2020},"citing_paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:44.257683Z"},"links":{"citing_paper":"/paper/2506.16020"},"observation_digest":"sha256:cca73d3562bab54b9010a5898f5df711fc6ceaef03adc7600fc33aa820794980","observation_id":"feda8574-5c2b-480e-bd39-342582047854","resolution":{"observed_at":"2026-08-06T23:53:44.843365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16020","last_updated":"2025-06-19T04:34:53Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T04:20:17.436262Z","submitted_at":"2025-06-19T04:34:53Z","title":"VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\\\"odinger Bridge"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.16020."}