{"as_of":"2026-08-18T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0b7448f7424d49635a0f837a54354c983683142c5b2555e5d605145af78420d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:07:09.893269Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03322/citation-record","integrity":"/paper/2608.03322/integrity","json":"/paper/2608.03322/citation-record.json","paper":"/paper/2608.03322"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:14.337164Z","title":"International conference on medical image computing and computer-assisted intervention , pages=","venue":null,"work_id":"e450c994-6729-4ca0-afa0-54e4b868ff39","year":2021},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.291303Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:cc411b9b34e3c95baf7acdb50b9e4c3e304e01ce8e511d46aff8768eef0ddd8e","observation_id":"8139d1e2-3c3a-4309-a652-b50b58240e49","resolution":{"observed_at":"2026-08-05T21:07:14.440464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:14.177502Z","title":"International Conference on Medical Image Computing and Computer-Assisted Intervention , pages=","venue":null,"work_id":"bf4c5a6f-4dc1-4ca4-ae9b-9fe75b00deda","year":2023},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.323838Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:3fda968ff622188ca8d22f67b7e034cad21f5a123834253767db02f3ffe5f008","observation_id":"798da038-d359-4dd3-bc2b-29e39aaafa7f","resolution":{"observed_at":"2026-08-05T21:07:14.235802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.967372Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":"579074b2-aa18-41d9-b383-49843e2d5d44","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.354778Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:c8844f981699b0813711e5737e2e5db977801e5c6d11220728cdeaef2c931766","observation_id":"34ec7a43-e77e-4a12-864b-b65bc4ffd6fd","resolution":{"observed_at":"2026-08-05T21:07:14.039872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27365","last_updated":"2026-05-27T02:30:49Z","snapshot_observed_at":"2026-08-15T00:47:32.172642Z","submitted_at":"2026-05-26T17:59:12Z","title":"LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27365","snapshot_observed_at":"2026-08-05T21:07:07.387536Z","title":"arXiv preprint arXiv:2605.27365 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.387536Z"},"links":{"cited_paper":"/paper/2605.27365","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:3f568ee2b637737207e05e6cc4aa1245a7837ac367c5faf6b3ef7266b3e04640","observation_id":"f3ceb8d4-476c-4986-b790-39f15fb39ec7","resolution":{"observed_at":"2026-08-05T21:07:07.387536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.810923Z","title":"Nature communications , volume=","venue":null,"work_id":"3b9aadb7-f7cf-4a76-acb3-dfcfc8322d7f","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.433529Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:92ab752cdb0a7ff891898c335ca09d6196b9a651c483810d811c715fd0ee0e39","observation_id":"6ec4edd4-a18a-4843-b5a9-59152b7a7b83","resolution":{"observed_at":"2026-08-05T21:07:13.872592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.668033Z","title":"Nature methods , volume=","venue":null,"work_id":"3227139b-3154-433d-af3b-82752caf515c","year":2025},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.468330Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:c72b6c7920accce3cfda6bf3f5c2dfdd9608eb8e6d18ed32b0d50697eeefc79f","observation_id":"4f2736d8-74e2-4d5b-8d6c-91256a884cde","resolution":{"observed_at":"2026-08-05T21:07:13.738062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.519268Z","title":"international conference on medical image computing and computer-assisted intervention , pages=","venue":null,"work_id":"56e85837-72d8-4e8f-80bd-a9915064b0f3","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.508242Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:c321f7634c941a97aa08462d1b2cd71bbdec685d680f41916f8a5deb06077647","observation_id":"59b2ecb1-120e-491d-b221-857adb44898f","resolution":{"observed_at":"2026-08-05T21:07:13.575409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08356","last_updated":"2025-06-11T12:15:03Z","snapshot_observed_at":"2026-08-16T11:31:39.482864Z","submitted_at":"2025-06-10T02:14:15Z","title":"MedMoE: Modality-Specialized Mixture of Experts for Medical Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08356","snapshot_observed_at":"2026-08-05T21:07:07.540354Z","title":"arXiv preprint arXiv:2506.08356 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.540354Z"},"links":{"cited_paper":"/paper/2506.08356","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:6f92e28a74409598dd113a5e63689a10602145554303ebe1aee04df4ec9bb79e","observation_id":"57e88c4d-9892-4f82-997b-395e7c3a7058","resolution":{"observed_at":"2026-08-05T21:07:07.540354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-16T17:02:27.821392Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04034","snapshot_observed_at":"2026-08-05T21:07:07.567191Z","title":"arXiv preprint arXiv:2506.04034 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.567191Z"},"links":{"cited_paper":"/paper/2506.04034","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:9c84112d6a8de4c2d81958226bfb0d90dafa9aa84c4fd74f5d03db5315f0fcd8","observation_id":"f388ae50-5da8-4c7b-828c-16459a5034e2","resolution":{"observed_at":"2026-08-05T21:07:07.567191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04477","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:10.757976Z","title":"arXiv preprint arXiv:2510.04477 , year=","venue":null,"work_id":"3affee6a-fdfb-4e02-9192-c12e1b2bff9c","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.598807Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:f9ee218dc8dd6f318e9d0c917f34dafd25e549da57c3936c49a15739471fdcc3","observation_id":"a2fcd220-4af4-4ced-9811-a1969e258422","resolution":{"observed_at":"2026-08-05T21:07:10.819578Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.412416Z","title":"Journal of medical imaging , volume=","venue":null,"work_id":"11d60164-354b-49d3-afdd-dee21f629148","year":2018},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.657756Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:3295222763a907ce5dcaf241c1aa8784fe00d511ec016f4731e9dd7303c56b6d","observation_id":"2f6eb89d-c272-4b9b-87fc-d06fe82f5a8f","resolution":{"observed_at":"2026-08-05T21:07:13.464628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.693581Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.693581Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:9fa6efae6d9947360ca517f373c0e81c49d037a2ceac4e5618a3ba7cdfdfbe0b","observation_id":"544d608b-642c-49db-8be5-36ac71182503","resolution":{"observed_at":"2026-08-05T21:07:07.693581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.291382Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"f4a43a34-ed48-4d56-9340-38ebecc67d3d","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.735063Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:5e41bd16e4c47df99d638cd31b7cb8e001d4f3b125a5b84d4b3a13727b176526","observation_id":"7f3499f1-877e-4ae3-bcf6-7a721c8371a0","resolution":{"observed_at":"2026-08-05T21:07:13.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:13.074588Z","title":"European conference on computer vision , pages=","venue":null,"work_id":"e5b0521e-b6da-4b85-b966-21b7cec39dce","year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.778837Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:2326cf5422007a4a9e9e11f959bb3eed200997160dc2c3fc9a482e3190c6c53d","observation_id":"2bd2698e-bf62-4d58-94e7-124c85a2665d","resolution":{"observed_at":"2026-08-05T21:07:13.172153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.802293Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.802293Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:e633a21d124aeead46532793c8855620308ab13b7a79f50921190d78c741b58b","observation_id":"6a4eae3b-817b-4988-a3fd-315e68536dc9","resolution":{"observed_at":"2026-08-05T21:07:07.802293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.838697Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.838697Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:daf956249a6e7fd94d05a205cdff621b62d61d64dc520be7ad9cd984b10f8e05","observation_id":"c8c46346-8a68-4dcd-8c56-1a320ba32416","resolution":{"observed_at":"2026-08-05T21:07:07.838697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.882591Z","title":"arXiv preprint arXiv:2510.12798 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.882591Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:18e3e5b8e7d23fbc788a63eed9cde944545fa945fce9b325e1927c96a5517f38","observation_id":"a378364e-1e5e-42da-acba-05ca18c631c6","resolution":{"observed_at":"2026-08-05T21:07:07.882591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.926263Z","title":"2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) , pages=","venue":null,"work_id":"cfefe204-2b83-42e8-ba44-d3d7d4408b1d","year":2026},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:07.931795Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:42845f6a7140d236bc49c4788178c0c56666993426b51978e632e52f6f225a14","observation_id":"085a2332-2867-4624-a043-da1bf3de5719","resolution":{"observed_at":"2026-08-05T21:07:12.986260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12694","last_updated":"2025-02-18T08:49:57Z","snapshot_observed_at":"2026-08-18T10:18:48.502861Z","submitted_at":"2024-10-16T15:54:11Z","title":"VividMed: Vision Language Model with Versatile Visual Grounding for Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12694","snapshot_observed_at":"2026-08-05T21:07:08.007254Z","title":"arXiv preprint arXiv:2410.12694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.007254Z"},"links":{"cited_paper":"/paper/2410.12694","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:a841d7523276d3b8174341e4b42632ac37a7e2b8cd0d7358ab0512aa617e0992","observation_id":"110f6385-b605-4c39-94a6-bc57dde51b2b","resolution":{"observed_at":"2026-08-05T21:07:08.007254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.824676Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"0766d34a-c5a3-46f3-9532-27c6169bf366","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.069248Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:483546b58afa9c25fa9f4577cadd71385999315239ea24fe8ec2be4888fc46f1","observation_id":"49ad6160-661a-4c88-b080-3bc11726618b","resolution":{"observed_at":"2026-08-05T21:07:12.882338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.727619Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"fa8d97a9-a0b6-4d45-a727-6fb9855cfc54","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.158591Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:781568e843a69c27979911e8456d117b0a0b5944498b8e9060fd1c2f595e4814","observation_id":"92b64d50-bfb0-4007-8452-c2d84cb062ac","resolution":{"observed_at":"2026-08-05T21:07:12.776827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.587588Z","title":"Nature Communications , year=","venue":null,"work_id":"8bfc45fd-b507-48dc-9ff4-388301f12b98","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.218339Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:08a8f39345fb9b181d8148b44b8b4392e21a21540afe2314df62ed12d645ed6f","observation_id":"539ca9fe-d91c-4f3f-8426-223cdba068c4","resolution":{"observed_at":"2026-08-05T21:07:12.672341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.287875Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.287875Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:877eaf9e49114ced3d306499be086488c3691ab779a35727daed03807afc9576","observation_id":"3652678f-b974-46c2-a861-824a124d0c48","resolution":{"observed_at":"2026-08-05T21:07:08.287875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.385821Z","title":"arXiv preprint arXiv:2601.06847 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.385821Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:dee00b3d646b71217831cac3d6a96d9f9b571946c8121299ab18ac88ad213816","observation_id":"d0f5a677-cf76-4f15-b909-147757ebb773","resolution":{"observed_at":"2026-08-05T21:07:08.385821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.406736Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"87f39a0a-b63f-49f6-adf1-0321317aaff0","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.421805Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:5c8bb0ec4bc6fa0df03567193bca662c59189760da9539d3d03e3f01e8fa0caa","observation_id":"bfc923ed-8082-4118-8eb6-30463cbad083","resolution":{"observed_at":"2026-08-05T21:07:12.461937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-12T14:22:37.782293Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-05T21:07:08.465735Z","title":"arXiv preprint arXiv:2505.14231 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.465735Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:9c9a279940bee665c7ca3f6fe54097529b7c74579ebdfca05cf7aa774349b4bb","observation_id":"c88710ae-06f9-4c58-bc6f-b9a7e8c8a542","resolution":{"observed_at":"2026-08-05T21:07:08.465735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.242463Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"4b98323a-d754-4437-998b-6fd617a44af1","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.521244Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:cc9c8620f6e2b6121b1f7eef397d991f388383a24f27ec1fcee9d094e3b3ec29","observation_id":"0021fea5-eb31-41b4-b5db-4ee7239a1c2d","resolution":{"observed_at":"2026-08-05T21:07:12.310068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.06665","last_updated":"2026-04-10T08:38:35Z","snapshot_observed_at":"2026-08-11T04:43:47.120694Z","submitted_at":"2026-03-02T10:32:44Z","title":"Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.06665","snapshot_observed_at":"2026-08-05T21:07:08.563485Z","title":"arXiv preprint arXiv:2603.06665 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.563485Z"},"links":{"cited_paper":"/paper/2603.06665","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:7c4636697d109821436d1590c2880904cf2bb22bd13885467ca72269844c0ec8","observation_id":"7baefc8b-2614-44e4-84bb-7fa50f48fa78","resolution":{"observed_at":"2026-08-05T21:07:08.563485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.634558Z","title":"Nature communications , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.634558Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:4ecb219868e2205d81678386a40eeb1e9449c86a22e431b5fcaee9e947d0f207","observation_id":"0cdb2e9e-7bca-4770-9a48-2ba6af965c1b","resolution":{"observed_at":"2026-08-05T21:07:08.634558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.695541Z","title":"Radiology: Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.695541Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:2cd2245b10bb31533d78fbd804cedda4a8cad3cbcae14bf6cc43a99b0a3a2ce1","observation_id":"98196b98-4ce3-4d47-94f3-30ac11d264a5","resolution":{"observed_at":"2026-08-05T21:07:08.695541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.748748Z","title":"Medical image analysis , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.748748Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:1f495aa682de0c498281057a5d425a5022d19cb3605ff092d7ff7bbd49d0b26a","observation_id":"b9446222-422b-47a8-bf0e-47cd25906429","resolution":{"observed_at":"2026-08-05T21:07:08.748748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:12.024208Z","title":"International Conference on Medical Image Computing and Computer-Assisted Intervention , pages=","venue":null,"work_id":"82abd405-a94b-4569-8d6f-c2df80824f62","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.786746Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:bf7c369ee7f0135ecd2493c0c33824ffea7fbc12008853b0c0fe12d3587dba25","observation_id":"e28eec6a-38e8-4e3f-b8bf-f709c7521296","resolution":{"observed_at":"2026-08-05T21:07:12.099143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.859374Z","title":"Medical physics , volume=","venue":null,"work_id":"d2580387-23b4-4768-9197-60141efb56be","year":2024},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.815007Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:6d79b7de38d97c7a505aa7309c43eb259291582eeabaca69e0a1df62d7146de4","observation_id":"3728f14f-26b9-4c6b-b8b5-5b7838536633","resolution":{"observed_at":"2026-08-05T21:07:11.934478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.666701Z","title":"Scientific data , volume=","venue":null,"work_id":"fe17dcf7-c69b-43fc-9540-fb078f0ee5ed","year":2022},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.851524Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:0ca1a7483efabcf515cc03a2a7f9d2f96751b2a6af149790c20b249826a3c83e","observation_id":"886c2177-2804-4377-a1c5-8790a793c558","resolution":{"observed_at":"2026-08-05T21:07:11.770374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.490981Z","title":"Scientific data , volume=","venue":null,"work_id":"8cc12d20-9edb-42e6-b027-c147746728dc","year":2023},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.877954Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:176cd24036b47d5a0bfec58ef06d3a62f17282e57f95ef2fefe9ecd71d497ec4","observation_id":"160b1582-f6be-48de-a60d-5ff7ccd42fd2","resolution":{"observed_at":"2026-08-05T21:07:11.537733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.919218Z","title":"arXiv preprint arXiv:2305.19112 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.919218Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:b374da450f45623e19c3652236b9ff88b3bdc26ec4ebf9b9af137fcae61a09b2","observation_id":"53f19895-266c-44f3-b1cd-03a41cd2adbe","resolution":{"observed_at":"2026-08-05T21:07:08.919218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.948707Z","title":"International conference on multimedia modeling , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.948707Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:c41d6c53318834bd7c1e15b984d8dbcd1c2e6c8a448fa2e9a648417d8df48b97","observation_id":"c8535cf8-1809-4a3e-8a35-262a22cdbf41","resolution":{"observed_at":"2026-08-05T21:07:08.948707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.356554Z","title":"saliency maps from physicians , author=","venue":null,"work_id":"79ec71d4-f0df-4278-b6e9-043591bd38a5","year":2015},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:08.996716Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:e3a3ae2b38a975cd0e83684ada418c8ad083d94299bfdf07a83beb2a5f1ae42c","observation_id":"ee625d8d-b7fe-43bd-bcf2-062ab53d7f6f","resolution":{"observed_at":"2026-08-05T21:07:11.392202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.271869Z","title":"Information Sciences , volume=","venue":null,"work_id":"5d8d5675-c9af-49b5-8d2c-a23739a09cec","year":2019},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.028296Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:50117355e9d8f717835bd2f908a8128a1e7bfa7c3210d6babed7a914a4929d01","observation_id":"7cade63a-ecd3-4fc1-9294-c121ba9e450b","resolution":{"observed_at":"2026-08-05T21:07:11.308346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:11.197739Z","title":"IEEE transactions on medical imaging , volume=","venue":null,"work_id":"97bf0c74-4a39-4721-be06-da13605142c3","year":2004},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.065811Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:5f451f3d989fc5f13af9ab541dbaeac7e6cb9b477afd7cec77cdc702aee42126","observation_id":"c60c39ba-7f7b-4009-bbea-c50fe9b3cc2b","resolution":{"observed_at":"2026-08-05T21:07:11.227731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:10.944746Z","title":"IEEE Transactions on Medical imaging , volume=","venue":null,"work_id":"774842ac-5e87-4105-9a3f-990a05cea8b3","year":2000},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.098336Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:85dd4affd3c5cf80edb4a5d79a5c093e461c0258b161d8ed8117aa69f70b2618","observation_id":"5dfb962e-91c8-4480-b4ce-152c824890a8","resolution":{"observed_at":"2026-08-05T21:07:11.062611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:09.170037Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.170037Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:89bdfbfe77a9db3ef230ce5ae645c275fc5dde6e511330a2fe83ec200844ce81","observation_id":"efe2f606-036d-4080-978e-e841ff6e7743","resolution":{"observed_at":"2026-08-05T21:07:09.170037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03748","last_updated":"2026-06-02T15:01:13Z","snapshot_observed_at":"2026-08-07T08:37:57.358483Z","submitted_at":"2026-06-02T15:01:13Z","title":"Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03748","snapshot_observed_at":"2026-08-05T21:07:09.213500Z","title":"arXiv preprint arXiv:2606.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.213500Z"},"links":{"cited_paper":"/paper/2606.03748","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:55c4ac7e423f97946c1211e640e3baa54afb9a2c42ad4427215639511db6f4f6","observation_id":"9d5ab858-d88d-4c63-bfa5-96bcbb3c514d","resolution":{"observed_at":"2026-08-05T21:07:09.213500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03459","last_updated":"2024-06-05T17:07:24Z","snapshot_observed_at":"2026-08-16T13:45:48.489705Z","submitted_at":"2024-06-05T17:07:24Z","title":"LW-DETR: A Transformer Replacement to YOLO for Real-Time Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03459","snapshot_observed_at":"2026-08-05T21:07:09.302031Z","title":"arXiv preprint arXiv:2406.03459 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.302031Z"},"links":{"cited_paper":"/paper/2406.03459","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:071ad81991684818f7096230a5c08949462c50dd55bf236e14a2cf364ff8c6e5","observation_id":"a9cd5b55-8b47-41bd-be3f-a25d42f77648","resolution":{"observed_at":"2026-08-05T21:07:09.302031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.18739","last_updated":"2026-08-16T15:58:09Z","snapshot_observed_at":"2026-08-18T10:13:07.361811Z","submitted_at":"2026-03-19T10:39:51Z","title":"EdgeCrafter: Compact ViTs for Edge Dense Prediction via Task-Specialized Distillation","version":4},"cited_work":{"arxiv_id":"2603.18739","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":"2603.18739","snapshot_observed_at":"2026-08-18T02:13:47.526664Z","title":"arXiv preprint arXiv:2603.18739 , year=","venue":null,"work_id":"47f1ab39-79cf-43c8-9b2e-c02435f3db82","year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.384132Z"},"links":{"cited_paper":"/paper/2603.18739","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:9884b53acb3642977d51c038eed6aebe72d9850b6e0faadcb749cf280236f8cc","observation_id":"6c6cbf1d-23fb-4ccb-85cf-f5d563015e11","resolution":{"observed_at":"2026-08-18T02:13:47.526664Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-05T21:07:09.449564Z","title":"arXiv preprint arXiv:2412.10302 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.449564Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:8317effa8ee26d812f0233877c9c79f57d519700c724c437e065be59becd4dd0","observation_id":"cb508499-4c1a-41a4-a672-9f366aa90408","resolution":{"observed_at":"2026-08-05T21:07:09.449564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:09.599566Z","title":"arXiv preprint arXiv:2512.17436 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.599566Z"},"links":{"citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:be2bfec957b288695be8cda437c070f3f0b4b023ed53915c27a9547111c26807","observation_id":"db45a968-61e3-45d5-b5c7-a97ac6f009bd","resolution":{"observed_at":"2026-08-05T21:07:09.599566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-08-05T21:07:09.717152Z","title":"5 technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.717152Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:017670127b1cce5329f5db3e8dddce69225d233570adbb2b2415f0467c8e0eaf","observation_id":"07a1f85b-7386-431d-b18e-40ed5284516e","resolution":{"observed_at":"2026-08-05T21:07:09.717152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T21:07:09.893269Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:09.893269Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03322"},"observation_digest":"sha256:caa82dd533bb5be5e58ee853b626ac535e5c7e14fbb69f8af7cfce1286ae2fed","observation_id":"6ebcfbae-2f97-459c-9f74-b717d95ccad2","resolution":{"observed_at":"2026-08-05T21:07:09.893269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03322","last_updated":"2026-08-04T08:29:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:06:20.003107Z","submitted_at":"2026-08-04T08:29:21Z","title":"LocAnyMed: Vision-Language Grounding for Multimodal Medical Images"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2608.03322."}