{"as_of":"2026-08-10T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1ef03205e4ab1b1e782c3da1f6248746e0f2c1e2ae0d889dbe0c9b46c574cc6","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:47:08.060954Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.09634/citation-record","integrity":"/paper/2506.09634/integrity","json":"/paper/2506.09634/citation-record.json","paper":"/paper/2506.09634"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T04:47:07.620921Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.620921Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:c246aeccdcf1770b740f0f4cbab7bfba649b6a56ee4b0c0a3df5e631c84421da","observation_id":"59d1df71-1389-4d58-8a2c-ee09b32c4a33","resolution":{"observed_at":"2026-08-07T04:47:07.620921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05091","last_updated":"2025-04-25T16:36:21Z","snapshot_observed_at":"2026-08-09T09:02:41.676028Z","submitted_at":"2025-02-07T17:10:22Z","title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05091","snapshot_observed_at":"2026-08-07T04:47:07.624830Z","title":"DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.624830Z"},"links":{"cited_paper":"/paper/2502.05091","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:37357e14f68d4411f28ec0bc02a4a1606c7c440fb96af26cee033fef3f593814","observation_id":"656efc58-2110-4998-a288-a64b06889b1a","resolution":{"observed_at":"2026-08-07T04:47:07.624830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-07-06T17:53:35.219482Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-07T04:47:07.628602Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.628602Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:aff25e7b1af1f1198316271fd308b7a001bcc2e78ad92e55c529653dc9f72d82","observation_id":"7a954a7c-d5a8-4442-ba12-c67648decd15","resolution":{"observed_at":"2026-08-07T04:47:07.628602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.631850Z","title":"Shah, Andrew Johnston, Robert D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.631850Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:da2fc5033bd351a26d8f995529c6e4c0181da3fbf80edb98867516958c9b1fc1","observation_id":"1c5b0f29-76a7-4997-9239-afd5e0597e8c","resolution":{"observed_at":"2026-08-07T04:47:07.631850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:14.439276Z","title":"Bruno, Eric A","venue":null,"work_id":"8e013273-c165-4f1d-a6a2-69f7f615c9c3","year":2015},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.634653Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:1c0ca1f5d225e777c453e8c1097fe6ae036286b4636b829b7bad312d616e903e","observation_id":"ddf966f4-e600-4c6d-aa4b-73395c2e83df","resolution":{"observed_at":"2026-08-07T04:47:14.534106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19330","last_updated":"2024-09-28T12:31:07Z","snapshot_observed_at":"2026-08-09T05:02:05.885998Z","submitted_at":"2024-09-28T12:31:07Z","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19330","snapshot_observed_at":"2026-08-07T04:47:07.637441Z","title":"3D-CT-GPT: Generating 3D Radiology Reports through Integration of Large Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.637441Z"},"links":{"cited_paper":"/paper/2409.19330","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:d78f019c3e15e2958dab4429212939863eab6be028f82809033b172547ad03df","observation_id":"4b26adec-b0b4-4955-ab61-8013d1320908","resolution":{"observed_at":"2026-08-07T04:47:07.637441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-06T18:57:51.817317Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-07T04:47:07.641054Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.641054Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:51488a0079277e61d0e0b2497beae8fac5759668565fe911d124a37b14561c65","observation_id":"48dcebf1-4bf3-43a9-822f-079ce5e67f00","resolution":{"observed_at":"2026-08-07T04:47:07.641054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-07T04:47:07.644114Z","title":"Dragonfly: Multi-Resolution Zoom Supercharges Large Visual-Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.644114Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:30f5e77b3022919e055393e54ea08c910b678fad41f69ca60e0a8f944495d246","observation_id":"95305907-eca2-414a-9d4f-20ead735841f","resolution":{"observed_at":"2026-08-07T04:47:07.644114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10799","last_updated":"2023-05-18T08:19:33Z","snapshot_observed_at":"2026-08-10T12:28:12.036375Z","submitted_at":"2023-05-18T08:19:33Z","title":"MedBLIP: Bootstrapping Language-Image Pre-training from 3D Medical Images and Texts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10799","snapshot_observed_at":"2026-08-07T04:47:07.647075Z","title":"MedBLIP: Bootstrapping Language-Image Pre-training from 3D Medical Images and Texts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.647075Z"},"links":{"cited_paper":"/paper/2305.10799","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:10363d722c98d31f1ff335009cec7e28e08054602f10800642812a72b86d6084","observation_id":"a76d515b-13ab-4ff0-8da7-1aa827f86195","resolution":{"observed_at":"2026-08-07T04:47:07.647075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:14.240703Z","title":"BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval","venue":null,"work_id":"0e9e90c2-db5a-4096-bd71-7d6c2b8d9129","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.650006Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:1f19e3a1acf3f5f33340770df2dca897d2264fe8f228fd6a1a9e8bf1919e7d14","observation_id":"37b70fec-5257-4c93-851d-29b00c830b61","resolution":{"observed_at":"2026-08-07T04:47:14.321988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16386","last_updated":"2024-03-25T03:02:51Z","snapshot_observed_at":"2026-08-08T15:58:56.716969Z","submitted_at":"2024-03-25T03:02:51Z","title":"Dia-LLaMA: Towards Large Language Model-driven CT Report Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16386","snapshot_observed_at":"2026-08-07T04:47:07.652832Z","title":"Dia-LLaMA: Towards Large Language Model-driven CT Report Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.652832Z"},"links":{"cited_paper":"/paper/2403.16386","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:c8eb828700af726405de8e4d6a160d19b15e2653c25066acfe3bbfc8cfea49d8","observation_id":"3a2baa62-f388-436a-95e3-6391794fb94d","resolution":{"observed_at":"2026-08-07T04:47:07.652832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:14.030921Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":null,"work_id":"222bb92c-102c-4b49-89e1-41637ec93877","year":2019},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.655589Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:6341931ec7b6e883768593d2c33e0c2df464a240af0bead1781216e57ce94a7f","observation_id":"594844b1-255a-40dc-ad4d-807471d347b9","resolution":{"observed_at":"2026-08-07T04:47:14.100340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.860052Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":"87e712f6-9b48-4b13-803a-b6c5815cfcad","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.658248Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:824f03d0b1bea3e08d1fb42a047c308f6673041a9abbb81c2307804c14e194dd","observation_id":"124937a7-342c-49b7-8b75-0f59990804b1","resolution":{"observed_at":"2026-08-07T04:47:13.968497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.660922Z","title":"Developing Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.660922Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:f713a1a10648a0e810c9c586ccaee1953e562b873971a42ce17ce9359f10e234","observation_id":"2b779508-9103-42b8-a0cb-631d79a054b6","resolution":{"observed_at":"2026-08-07T04:47:07.660922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T04:47:07.663591Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.663591Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:efb08c77ea7c7a5ce9c5a379b4fb19688554c42b8171ac4aa293e902241386cd","observation_id":"4feccbb4-ac79-4e5d-ad6f-7d192f85fe18","resolution":{"observed_at":"2026-08-07T04:47:07.663591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.604001Z","title":"Ball, Norah Borus, Andrew Huang, Bhavik N","venue":null,"work_id":"87abdf21-71fb-41cd-b52b-dac50f7e8203","year":2020},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.666325Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:cca9af7161f3d17c0a178399d9b68726520d9bcc15aa02248b077fd78b562f42","observation_id":"f5fff607-8b6c-4f1d-923e-6379ef9deebd","resolution":{"observed_at":"2026-08-07T04:47:13.708650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.363301Z","title":"Lungren, und Serena Yeung","venue":null,"work_id":"98a731c4-0730-462b-ae9c-d447a94cd77c","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.669216Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:449981ebf572dfde365f2de58c021ab71929a2981c530fda93b9c7b5aec57f42","observation_id":"b356897e-0e06-49ab-90ae-43215cb14aa4","resolution":{"observed_at":"2026-08-07T04:47:13.488370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.313493Z","title":null,"venue":null,"work_id":"b3f70def-0674-4e70-853a-757883d42b50","year":2018},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.672081Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:71fcd3b465c0211d7542b27cd49899d718ddd354dcfe9edd4516174ff46481a4","observation_id":"556ea59f-01cf-47ae-9322-af38c4d2464b","resolution":{"observed_at":"2026-08-07T04:47:13.321335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:13.032453Z","title":"MDAgents: An Adaptive Collaboration of LLMs for Medical Decision-Making","venue":null,"work_id":"e55e337e-2f17-46af-bc33-59dc628f7e2c","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.675122Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:7fbd82fd399f773c595d9be890bc68fad3152fc2372dd3208953fc386d68a25b","observation_id":"79a40d5c-1666-4444-a0c4-39568d4a1496","resolution":{"observed_at":"2026-08-07T04:47:13.159421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14200","last_updated":"2024-10-18T06:31:40Z","snapshot_observed_at":"2026-07-06T19:35:48.603411Z","submitted_at":"2024-10-18T06:31:40Z","title":"E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14200","snapshot_observed_at":"2026-08-07T04:47:07.677788Z","title":"Kevin Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.677788Z"},"links":{"cited_paper":"/paper/2410.14200","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:902c4adf961fd5154a6d97ab7da48f53d3b1a1410ca062111b80b1d2db105ed0","observation_id":"3cbc623f-fd10-44ae-abf3-1f67173aa724","resolution":{"observed_at":"2026-08-07T04:47:07.677788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.03565","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:08.488630Z","title":"Kevin Zhou","venue":null,"work_id":"13755d4c-d00b-4048-9f39-c46e3bbfbad9","year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.680780Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:01c86b5c589ce8814c765abd4548b9a4aff7ea8254df125babfdf4a901908ba4","observation_id":"f398a14c-3cd1-4287-a0f3-2c58b6662927","resolution":{"observed_at":"2026-08-07T04:47:08.567433Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.821806Z","title":"METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments","venue":null,"work_id":"642220ba-3497-4a78-a23b-49fe27c3f89c","year":2007},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.683384Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:474188c1e844c7af8f1c1cfa2045b13544b39872d1d80e69fcf9512ec91a555c","observation_id":"a5794760-a898-4bd0-beee-2b7d456c3087","resolution":{"observed_at":"2026-08-07T04:47:12.937482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.695048Z","title":"Towards a holistic framework for multimodal LLM in 3D brain CT radiology report generation","venue":null,"work_id":"c33eb43f-1b3e-4579-abf7-6898d9c7f05e","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.686018Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:5819a0a20dd2ee7c664a1fab127748b7a9072f949727b303e01b7a229384f767","observation_id":"e444ef61-6a4c-40c4-b933-5116bbda84a8","resolution":{"observed_at":"2026-08-07T04:47:12.755672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.437908Z","title":"LLaV A-Med: Training a Large Language-and- Vision Assistant for Biomedicine in One Day","venue":null,"work_id":"01639093-830a-490f-b754-ec15636a93b7","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.688760Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:ee08a9a5d2e965d00098d381d120e0689f82ce5279d903bd09ba27732a6d9c6b","observation_id":"7e10a83b-decf-4894-b774-0bef881cfbcb","resolution":{"observed_at":"2026-08-07T04:47:12.584478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.236907Z","title":null,"venue":null,"work_id":"5ecedbb9-f376-457a-8b57-1cbe6904f2f8","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.691469Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:b24b3c95e04f1775f409099b06082b9584f0996c0ced0aef1d8a7ea956594157","observation_id":"ff9013ea-85a7-4230-833d-a2291a85dc49","resolution":{"observed_at":"2026-08-07T04:47:12.340999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:12.094392Z","title":"Dynamic Graph Enhanced Contrastive Learning for Chest X-ray Report Generation","venue":null,"work_id":"788b255b-9db7-4ff0-ba22-4eed9ccc31ad","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.694107Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:7e584ec5ee6592be5cf66588d3a8b929e8eb4a3a05bfeeed7c891d46c935bc86","observation_id":"1e1d1347-ba9f-44c9-99d4-540f68fcd32a","resolution":{"observed_at":"2026-08-07T04:47:12.149866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T04:47:07.697677Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.697677Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:22f5179f4bad9ecd2a6f64da1b915b9967d7ae2b791f36f72ba15f0e0254b850","observation_id":"4adaa931-5207-495e-bbd1-7f0ca55cb3db","resolution":{"observed_at":"2026-08-07T04:47:07.697677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T04:47:07.700642Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.700642Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:5fe145ebdd5c2d1f9168796d34cfee414a2d86d80a99ba991320cd5c0f766146","observation_id":"d752036f-f3da-41d7-bf24-79bda8a8573c","resolution":{"observed_at":"2026-08-07T04:47:07.700642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.931907Z","title":"Macro-and micro- anatomical, histological and computed tomography scan characterization of the nasopalatine canal","venue":null,"work_id":"94f0985d-a637-41ea-919b-7440e95d01e3","year":2009},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.703490Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:fccc0994e009d74791f8d9ee3cfa2a6f70300ea801ff4264d22459f4bd5e0fa6","observation_id":"3f76dae1-5a53-4bd6-b0d0-5d850f82c64a","resolution":{"observed_at":"2026-08-07T04:47:12.020007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.761862Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"3c1cd704-05a1-4f92-b3ce-d9f74f90c0a5","year":2004},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.706327Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:19964e0e0a9b418d3a515c5f64102dcaec920633fa087e10972db4238be256a3","observation_id":"910fd7f9-d15c-495d-9346-30f4a4f64400","resolution":{"observed_at":"2026-08-07T04:47:11.842518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05876","last_updated":"2024-12-08T09:45:59Z","snapshot_observed_at":"2026-07-06T20:03:25.000927Z","submitted_at":"2024-12-08T09:45:59Z","title":"MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05876","snapshot_observed_at":"2026-08-07T04:47:07.708862Z","title":"MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.708862Z"},"links":{"cited_paper":"/paper/2412.05876","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:29bf41412f2e05950bc8254c77e29f2f4ffe0664049d08877a8e7ca609653898","observation_id":"40c0597a-cc1a-444e-999d-9166c23816f1","resolution":{"observed_at":"2026-08-07T04:47:07.708862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.566665Z","title":"Bleu: a Method for Auto- matic Evaluation of Machine Translation","venue":null,"work_id":"fe418698-a006-408f-88f0-ff50827c7e8d","year":2002},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.711866Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:8759690ad1720123a9dbf53a9fe3f02d6f2925d72fff069b7b4d3ca5902972e6","observation_id":"2a42e4d0-3fa2-499c-a749-a9664e804bd4","resolution":{"observed_at":"2026-08-07T04:47:11.676720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.423149Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"485ede52-0559-4dcb-80a5-e0b3b980423f","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.714448Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:d278931393112e25921a4463db1863fe83a1a194f281795c202168d8d8d7368c","observation_id":"d16d19a9-7886-4572-a920-c0f099914bdc","resolution":{"observed_at":"2026-08-07T04:47:11.474165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.277997Z","title":"Salvolini, E","venue":null,"work_id":"c20b75aa-f9df-462c-89f8-802c4086b57a","year":2000},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.717125Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:8ee24bdbf0dfbd9da9e2e0a8f8eafe6e89da143841f191908b0a73632a123d14","observation_id":"e89def40-1a80-42a2-b779-0d5302249e3b","resolution":{"observed_at":"2026-08-07T04:47:11.349751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:11.096961Z","title":"Time Is Money: Considerations for Measuring the Radiological Reading Time","venue":null,"work_id":"72163a34-78ae-43d6-b273-e98249b91642","year":2022},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.719912Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:17d468bc23766b28e3f79dd51376a602cc89692729970d2552cfb64d9dca7546","observation_id":"d7c55625-fda1-40c0-b6bb-b382ad468434","resolution":{"observed_at":"2026-08-07T04:47:11.173127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.722774Z","title":"Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.722774Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:35793f95fdd91f9d67183c542eb5059828ac829589bcfb042b30b2f6f3099e9c","observation_id":"5b7dceb2-6ae9-4f9d-9767-12fea05b9215","resolution":{"observed_at":"2026-08-07T04:47:07.722774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.929630Z","title":null,"venue":null,"work_id":"e4ba608b-47e9-4cf8-9caa-b149447b3a72","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.725473Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:05a754c0135c24cb5d6ebe4e6146616c77ce23cd50e7269a3f7f2f5c3f981daf","observation_id":"7480eb91-463e-4c1b-b889-80e3340626b9","resolution":{"observed_at":"2026-08-07T04:47:11.001306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.776490Z","title":null,"venue":null,"work_id":"2e2636c1-e0b6-4037-b6f1-3a6f21306a8a","year":2021},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.728638Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:1f2776e7fcee8ab01041e25d52e86d28fcc9ea80f45711b339e46c7a92a5bc69","observation_id":"7e9939ad-ea6f-4414-a99a-344e21c0a209","resolution":{"observed_at":"2026-08-07T04:47:10.861999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14334","last_updated":"2023-07-26T17:52:22Z","snapshot_observed_at":"2026-08-02T04:14:16.530924Z","submitted_at":"2023-07-26T17:52:22Z","title":"Towards Generalist Biomedical AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14334","snapshot_observed_at":"2026-08-07T04:47:07.731105Z","title":"Fleet, Philip Andrew Mansfield, Sushant Prakash, Renee Wong, Sunny Virmani, Christopher Semturs, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.731105Z"},"links":{"cited_paper":"/paper/2307.14334","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:21fd359fb6a4fef8da03fb8b18fc3b928f4092ca28e9ac27a6fe98819bb4c678","observation_id":"d3d44794-c411-4187-8c28-c7d1cc90b1b5","resolution":{"observed_at":"2026-08-07T04:47:07.731105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T04:47:07.733934Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.733934Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:e130420f26bcc21703eb6c0c63a94335f3b90e8bec130579c8f968424804707c","observation_id":"1f57a25c-8f75-4339-8799-4a0e942798c7","resolution":{"observed_at":"2026-08-07T04:47:07.733934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.527297Z","title":"Cross-modal prototype driven network for radiology report generation","venue":null,"work_id":"ca787088-df93-45e9-a2d7-6c7c21dfff45","year":2022},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.736992Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:084a771e3ec3932c94b4dabccca1e0a3305d530e452edcfaa112c02a325ef759","observation_id":"fa98463d-1155-416d-867b-0f2e6da219b4","resolution":{"observed_at":"2026-08-07T04:47:10.670325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19546","last_updated":"2025-04-16T16:00:52Z","snapshot_observed_at":"2026-08-05T03:55:02.023089Z","submitted_at":"2024-07-28T17:38:21Z","title":"MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19546","snapshot_observed_at":"2026-08-07T04:47:07.741096Z","title":"XLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.741096Z"},"links":{"cited_paper":"/paper/2407.19546","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:837117795f96547b415e688b28068de1b6a7d4dc4f492ede1b1184eef45ad3c0","observation_id":"fd024453-c5ee-4cd6-b23a-8214a5f63df9","resolution":{"observed_at":"2026-08-07T04:47:07.741096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02463","last_updated":"2023-11-16T12:38:46Z","snapshot_observed_at":"2026-08-08T04:57:05.131540Z","submitted_at":"2023-08-04T17:00:38Z","title":"Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02463","snapshot_observed_at":"2026-08-07T04:47:07.745722Z","title":"Towards Generalist Foundation Model for Radiology","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.745722Z"},"links":{"cited_paper":"/paper/2308.02463","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:ca5c0fc88059f6fd648489f928d4339e372b7520ea341ea0ab9e38f0bd9f355a","observation_id":"98a3ec93-657c-4a92-bf45-7c1b99b0c292","resolution":{"observed_at":"2026-08-07T04:47:07.745722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.317967Z","title":"Zou, und Huaxiu Yao","venue":null,"work_id":"826c3fa7-26dc-434f-884d-91e683e2863b","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.752474Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:048bad1872466918f7df8d3baaa33ddc8af12ec50be7de6072a241998ce888be","observation_id":"883a7492-0f61-419c-868a-29c40e50901f","resolution":{"observed_at":"2026-08-07T04:47:10.399927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:07.756129Z","title":"Med3DVLM: An Efficient Vision- Language Model for 3D Medical Image Analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.756129Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:a729193dbc43945f7b00a65705b9f761b2bb1f86f6142f86c8a6f0564e177d98","observation_id":"0d50dc99-07f8-4d3a-a0b8-dbf602292b1d","resolution":{"observed_at":"2026-08-07T04:47:07.756129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:10.092571Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":null,"work_id":"74d4529d-c3c1-42c5-a908-11816f3ff16e","year":2023},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.760736Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:ae9c80279b9eecf0a4dba9655492ba726e9084f48f3827670e049c0412240efc","observation_id":"f3bc874f-1ec7-4a1a-a361-98eefc53a0bb","resolution":{"observed_at":"2026-08-07T04:47:10.209432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.895374Z","title":"Lungren, Tristan Naumann, Sheng Wang, und Hoifung Poon","venue":null,"work_id":"ba86390a-a661-4838-b3f5-6e60506191fb","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.770261Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:9ea4b62fb5fa4573959c2edcc65af3901c8df969429a104d83aab279a342e2dd","observation_id":"3eb5ce39-5de0-4804-8dca-ccda4f254aa2","resolution":{"observed_at":"2026-08-07T04:47:09.979845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.708726Z","title":"Weinberger, und Yoav Artzi","venue":null,"work_id":"f7d98f5c-ccb5-4e4f-a5e4-38fcdf6c5163","year":2020},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.784587Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:2a305d39dbb181f067dfa8ce606213f2839a425fe241c874661a242b7dd29778","observation_id":"a8424c63-97ce-46e9-8a0a-4604076e458d","resolution":{"observed_at":"2026-08-07T04:47:09.799164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.418685Z","title":"MEPNet: Medical Entity-Balanced Prompting Network for Brain CT Report Generation","venue":null,"work_id":"a5951e2f-1b06-40b6-954e-82f294192e12","year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.805586Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:01a263e7abc3bf9f10664ef6a3fe66c46d58c9d5b2753f8e57262b6d0d9a929a","observation_id":"12f782b5-3cf3-4c2f-9a47-c9d7f591e4ac","resolution":{"observed_at":"2026-08-07T04:47:09.557804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16754","last_updated":"2024-04-25T17:11:37Z","snapshot_observed_at":"2026-08-07T21:48:29.327261Z","submitted_at":"2024-04-25T17:11:37Z","title":"RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16754","snapshot_observed_at":"2026-08-07T04:47:07.828501Z","title":"RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.828501Z"},"links":{"cited_paper":"/paper/2404.16754","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:ee44d46a624e191ade3b7ef4aa3350d0c4860a9ec30a71399eec7eec1c104a9c","observation_id":"3f99ebed-d651-47b5-87b0-1f2f8c00f6b6","resolution":{"observed_at":"2026-08-07T04:47:07.828501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:09.134461Z","title":"There are emphysematous changes in both lungs","venue":null,"work_id":"c2b62c68-7c93-4866-b398-32c14acf978a","year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.941763Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:cec10e55515b3c2659c3a2b3d7415c71cfab250df84ec40a24a1ec7f288b5a3c","observation_id":"dd49e689-3feb-418a-a7b8-e50e15fce348","resolution":{"observed_at":"2026-08-07T04:47:09.276205Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:47:08.902008Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"b709add0-26e1-488b-a7b2-c75a2f354a53","year":2025},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:08.060954Z"},"links":{"citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:14dc381727bddc5d4e4895ee90716f6336712e31236879f2e7329519d3ca5eae","observation_id":"16f3d46d-e57f-4dec-a54b-23b8802df80d","resolution":{"observed_at":"2026-08-07T04:47:08.987645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T13:38:35.843554Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2506.09634."}