{"as_of":"2026-08-17T21:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54b371dc396584599069fd46ec75f2fdb9b0d72a08e998e3c1e04b9a53fe98ad","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:07:46.857185Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.10764/citation-record","integrity":"/paper/2505.10764/integrity","json":"/paper/2505.10764/citation-record.json","paper":"/paper/2505.10764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.439876Z","title":"Almeida, R","venue":null,"work_id":"277171d1-4fdc-4d07-9d0a-a7355304fe1d","year":2009},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.690704Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:a8540c0cc44bcf9af906957dc48b14ec0097d84e77447fa0a7410eafa6e39848","observation_id":"e60926cf-af69-400e-8546-520ccbdaed2c","resolution":{"observed_at":"2026-08-15T21:07:47.444692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.425467Z","title":"Abdulbaki Alshirbaji, H","venue":null,"work_id":"a789ba61-478b-48ee-ac3f-05c8114b9a47","year":null},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.695764Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:4af857d86110876a9e9a32283422038ea42408b05548981b01670ba9f6f00578","observation_id":"389e6699-ac1d-4bad-a0d9-5d4e89935510","resolution":{"observed_at":"2026-08-15T21:07:47.430149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.410893Z","title":"Vision-based and marker-less surgical tool detection and tracking: a review of the literature","venue":null,"work_id":"4f22ef67-890c-4dd3-a3d1-c61e41d79cbd","year":2017},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.700152Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:7a641294a79728906ca7d5b0b5c420449d6d7a487a5b68ccc96d8435931ddef8","observation_id":"dc060ca3-5ddf-47d6-87da-dc81a4650236","resolution":{"observed_at":"2026-08-15T21:07:47.415825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.396627Z","title":"Grad-cam++: Generalized gradient-based visual explanations for deep convolutional networks","venue":null,"work_id":"c2b2e84a-d731-46ed-b2b2-f5922799083e","year":2018},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.704830Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:60ebd7fa4bd827665c4927b3f7a8cab88b988b7f13a66b19864fba25afa9fc87","observation_id":"a954791e-9dd8-4009-b88d-3e8ad88260eb","resolution":{"observed_at":"2026-08-15T21:07:47.401341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.382214Z","title":"Generic attention-model explainability for interpreting bi-modal and encoder-decoder transformers","venue":null,"work_id":"ad4605c5-36d0-4f8f-8345-88771dba7740","year":2021},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.709653Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:42f07aec8ef532e65dfd5614b5d6245b7fa1984b36f66e7a91ff8a94f10048d4","observation_id":"3a0440d2-1a60-4d91-be8b-5226ce1ca000","resolution":{"observed_at":"2026-08-15T21:07:47.386898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.368103Z","title":null,"venue":null,"work_id":"36a1d400-04c5-4a67-b76b-4f4d7322179d","year":2020},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.714640Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:d46cdd6443747364f6f67f081fed504af36e73556988e094f69c49b3ddbcc411","observation_id":"77194edf-ce30-4848-a722-7f798ad3a5ee","resolution":{"observed_at":"2026-08-15T21:07:47.372561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.353938Z","title":"Robotic surgery.Nature Reviews Bioengineering, pages 1–14, 2025","venue":null,"work_id":"e2ae614b-e4fa-4b95-b83f-341be142f46d","year":2025},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.719094Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:a5db976826c58fefa25f7b14e1866c5c712410a64da1b4024d9d3549661b7ba0","observation_id":"a819e996-22dd-471c-9336-6f16c5e13ce2","resolution":{"observed_at":"2026-08-15T21:07:47.358573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.340175Z","title":"Dosovitskiy, L","venue":null,"work_id":"d2c4177b-b3c8-4db5-bbed-79d68123879f","year":2021},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.723809Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:4a38c538067ad7668fceb75aa783c484db017ff0eb1c4905d8adaf451cca2b80","observation_id":"fa9b85ec-45bf-489d-9bac-94fb6e6961c7","resolution":{"observed_at":"2026-08-15T21:07:47.344476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.326149Z","title":"A decade retrospective of medical robotics research from 2010 to 2020.Science robotics, 6(60):eabi8017, 2021","venue":null,"work_id":"f1b42d65-a9b1-4ca3-acff-8ef22b0587db","year":2010},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.728329Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:972e68f8b7a3278241226fe7b7cf5cc3410c5dd3a171c3b4dbba0226737f2809","observation_id":"553bf8d8-c5d9-427b-8b1f-3ddfcc358a2b","resolution":{"observed_at":"2026-08-15T21:07:47.331021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.312515Z","title":"Toolnet: holistically-nested real-time segmentation of robotic surgical tools","venue":null,"work_id":"03594cbd-cd8a-44b3-99e6-8c631f67aff8","year":2017},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.732767Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:29da3abda288deff93e9d25460b719e9e72bef885fa12bfa575f29dfcf10fb52","observation_id":"183d11b3-0f93-45e0-92c5-59a258bf0897","resolution":{"observed_at":"2026-08-15T21:07:47.316972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.298113Z","title":"Goyal, Z","venue":null,"work_id":"fb4de61d-4796-4035-864b-1ba957d10eae","year":2019},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.737435Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:84c9743ed5095d1cfc9f7963b1827ff0ae371b93a43f74507c7e842e72640e53","observation_id":"b2fda3f3-f2f3-4503-9550-e3822174cb38","resolution":{"observed_at":"2026-08-15T21:07:47.302874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.283581Z","title":null,"venue":null,"work_id":"b39cf453-11ff-4612-a853-9d07b8cbb719","year":2016},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.741974Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:3e5eb7465d827a1288557c9b29c90ff968199bdfbb5721da5b2897493bb3e01e","observation_id":"4f062208-5671-4dd0-a4b8-0476c0514ded","resolution":{"observed_at":"2026-08-15T21:07:47.288017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.269604Z","title":null,"venue":null,"work_id":"2787943f-4849-469b-b5a0-ce8fef7318de","year":2023},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.746137Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:efd9e3606134d9f7f69e8a5ce55f0b32843f5b3f3c38c688cd7fd4eab42cc3b2","observation_id":"458c409e-8b37-4913-9d8f-f20016f604c6","resolution":{"observed_at":"2026-08-15T21:07:47.274102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.254946Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"28e5c7b6-f027-4d41-967d-b5afb5bb8daa","year":2022},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.750389Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:10a5a5b533d6609002ee18dc22a88dbdc0b2dffcdb02be77c94f526553bcec23","observation_id":"608db306-805d-4326-a4e6-71739dd52c19","resolution":{"observed_at":"2026-08-15T21:07:47.259851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.239951Z","title":"Lc-gan: Image- to-image translation based on generative adversarial network for endoscopic images","venue":null,"work_id":"ba126f0e-eeed-4eda-9924-17d3e65b7404","year":2020},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.754753Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:fb828ec60ced7ab881c19c6b7da5dd26f306516a6e97fbeab080e4d14fdd5902","observation_id":"f2a217b0-a9d3-4a92-a33f-ffd31c07dac5","resolution":{"observed_at":"2026-08-15T21:07:47.245084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.223732Z","title":"Multi-frame feature aggregation for real-time instrument seg- mentation in endoscopic video.IEEE Robotics and Automation Letters, 6(4):6773–6780, 2021","venue":null,"work_id":"779cb982-461c-4a67-8d8f-e6e4fa3179d0","year":2021},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.758889Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:564c0b24f04c057743083847fd06fe1f1386599631a897150bbbf3b26d426b2b","observation_id":"09a1d9fd-ebef-4da9-a0c9-e5a47dd2fd50","resolution":{"observed_at":"2026-08-15T21:07:47.229141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.207073Z","title":"Visual instruction tuning.Ad- vances in Neural Information Processing Systems, 36:34892–34916, 2023","venue":null,"work_id":"592894bf-abab-401f-a092-8d7eb716fcac","year":2023},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.762745Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:66d40380a3dc1a6fdbd303d8ba523a79f27b17650b647b0fe43ccc7eb985e460","observation_id":"a94bf806-2bdd-4a2a-9bfd-4597ab9f23d3","resolution":{"observed_at":"2026-08-15T21:07:47.212229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.192228Z","title":"Attention-guided lightweight network for real-time segmentation of robotic surgical instruments","venue":null,"work_id":"5474db4b-ccc6-48e1-b5a6-513c2ea3338f","year":2020},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.766780Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:4ebbc6e4eab7ac495dbe8d9f57869a6f8eca21f913bb78d4dd4109aa28b77bc3","observation_id":"da9bf049-ce0c-4f48-8008-298c0c4a0f37","resolution":{"observed_at":"2026-08-15T21:07:47.197362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.176795Z","title":null,"venue":null,"work_id":"82f791e7-a9f1-4c64-8207-b10762062c3e","year":2022},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.771115Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:630bd4942e318e18eae97ccd8da9a30b3977a51c2be01976ffb17396584b9e36","observation_id":"b1a766a8-42b1-4ca1-ac1f-cdfe3fc0de06","resolution":{"observed_at":"2026-08-15T21:07:47.181937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.16061","last_updated":"2020-10-11T02:15:11Z","snapshot_observed_at":"2026-08-16T19:14:25.354526Z","submitted_at":"2020-10-11T02:15:11Z","title":"Evaluation: from precision, recall and F-measure to ROC, informedness, markedness and correlation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.16061","snapshot_observed_at":"2026-08-15T21:07:46.775660Z","title":"Evaluation: from precision, recall and f-measure to roc, informedness, markedness and correlation.arXiv preprint arXiv:2010.16061, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.775660Z"},"links":{"cited_paper":"/paper/2010.16061","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:6cf57bfa785aae79bb9a2f29966795e4e063837d4360cb31182f63aba600679e","observation_id":"4b285379-a563-43d9-b861-90f1ed800187","resolution":{"observed_at":"2026-08-15T21:07:46.775660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.162313Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"550c408e-b0bc-43ad-8767-3a2f18af3b5b","year":2021},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.780120Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:301dd5d55297fe53f790065ee0932cb8ac5975adcf7e373d905be07178fd2684","observation_id":"89539047-cb6c-4671-aa2f-456c272ea106","resolution":{"observed_at":"2026-08-15T21:07:47.166701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02799","last_updated":"2025-04-03T17:42:56Z","snapshot_observed_at":"2026-08-16T12:44:10.842582Z","submitted_at":"2025-04-03T17:42:56Z","title":"Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence","version":1},"cited_work":{"arxiv_id":"2504.02799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02799","snapshot_observed_at":"2026-08-15T21:07:46.966081Z","title":"Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence","venue":"cs.CV","work_id":"e90fdbf5-f768-49f5-b8b7-946352fd0a3a","year":2025},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.784102Z"},"links":{"cited_paper":"/paper/2504.02799","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:f68f9546afc084fe13f3974aca8efbfc809dd49129b1ae133dae4b5ada76b91e","observation_id":"9915387b-9a07-495b-8aef-a00823df3d23","resolution":{"observed_at":"2026-08-15T21:07:46.973743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.147468Z","title":null,"venue":null,"work_id":"ba890949-ab95-4e47-bca0-7c6a6f9860cf","year":2023},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.788310Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:57ccf981beb08343536cd4dbd2f1179aeecd22a672e5f196ecf1ceeb9a744a22","observation_id":"70d5e674-dab5-4169-b54d-13606aaf62db","resolution":{"observed_at":"2026-08-15T21:07:47.151974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:46.792484Z","title":"Comparative validation of multi-instance instrument segmentation in endoscopy: results of the robust-mis 2019 challenge.Medical image analysis, 70:101920, 2021","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.792484Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:b82510ee2003c77efcf23790c30452810b95a183c88ea9750760347b739ae97c","observation_id":"2dfb96d3-d373-4420-9005-6c7e06b41c7c","resolution":{"observed_at":"2026-08-15T21:07:46.792484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:46.796405Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.796405Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:53eba8d48db89e74323545a0b792789000781afc84fb97e124c783b808a32b0f","observation_id":"9db1583e-184a-4bfc-9cba-4b171939d7f3","resolution":{"observed_at":"2026-08-15T21:07:46.796405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03118","last_updated":"2024-06-24T22:45:20Z","snapshot_observed_at":"2026-08-16T14:03:47.945478Z","submitted_at":"2024-04-03T23:57:34Z","title":"LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03118","snapshot_observed_at":"2026-08-15T21:07:46.800582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.800582Z"},"links":{"cited_paper":"/paper/2404.03118","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:af5d6172a66704896570e20116c38f3e65ed943a052201e0e5b3bc3d5ff12bee","observation_id":"5b9899bb-4eb7-4022-a506-2cbb82a0ec4e","resolution":{"observed_at":"2026-08-15T21:07:46.800582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.114243Z","title":"Teed and J","venue":null,"work_id":"983b368f-2751-4349-8968-43d957dce6de","year":2020},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.805596Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:f06e70a2284682c5dd9a8118cfb312d5120c91c7c726961580bf4ecb5bee2627","observation_id":"42582ce1-4f11-41e5-9fbf-1fa5c293a479","resolution":{"observed_at":"2026-08-15T21:07:47.118857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.098456Z","title":"Endonet: A deep architecture for recognition tasks on laparoscopic videos.IEEE Transactions on Medical Imaging, 36(1):86–97, 2016","venue":null,"work_id":"df84c0b5-bbe4-4e3a-b28d-4e40a7ddfbc0","year":2016},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.810596Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:be0173bfcf516b2307bd3d3afe1dfa3a4c293fa0c233b87439c2d2fe5c410d9c","observation_id":"db790e7c-0331-4f1a-907e-9f49c8243820","resolution":{"observed_at":"2026-08-15T21:07:47.104054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05235","last_updated":"2023-02-28T17:12:35Z","snapshot_observed_at":"2026-08-16T17:07:43.883098Z","submitted_at":"2022-04-11T16:32:25Z","title":"Data Splits and Metrics for Method Benchmarking on Surgical Action Triplet Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05235","snapshot_observed_at":"2026-08-15T21:07:46.814658Z","title":"Cholect50: A benchmark for surgical action triplet recognition.arXiv preprint arXiv:2204.05235, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.814658Z"},"links":{"cited_paper":"/paper/2204.05235","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:194ed42db2e9ae8aca80a92492d9537ae34d3e5259a2097b2d6e84ba63d6db27","observation_id":"19021599-9a95-4c6b-945f-c72ad9611898","resolution":{"observed_at":"2026-08-15T21:07:46.814658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.083540Z","title":"Yuille, and Wei Shen","venue":null,"work_id":"df5984c0-87bb-4db3-af0f-9daff2f401b0","year":2020},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.819296Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:a647abd097313ac784ba0e3cc3b8a13ae7f3a6015a74b2666281e0480dd941a9","observation_id":"a13641bd-9548-40b1-8d0f-42f0479fd553","resolution":{"observed_at":"2026-08-15T21:07:47.087995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.069374Z","title":"The robot will see you now: Foundation models are the path forward for autonomous robotic surgery.Science Robotics, 10(104):eadt0684, 2025","venue":null,"work_id":"036513d1-7e49-492e-a26a-7340c72dc74e","year":2025},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.823301Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:1e92b8727d8e65f747fa1872b213f907e9c2bf7339144e95933bae8e67b716fc","observation_id":"285878ed-c13d-4dca-8202-265a432a30cf","resolution":{"observed_at":"2026-08-15T21:07:47.073857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10075","last_updated":"2025-03-13T15:27:41Z","snapshot_observed_at":"2026-08-16T13:52:10.756237Z","submitted_at":"2024-05-16T13:14:43Z","title":"HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10075","snapshot_observed_at":"2026-08-15T21:07:46.827584Z","title":"Hecvl: Hierarchical video-language pretraining for zero-shot surgical phase recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.827584Z"},"links":{"cited_paper":"/paper/2405.10075","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:1b8203138c66b0f7df037346f89fc53370335469029570627b2735b7e281a3f0","observation_id":"2b2789ea-e37b-45d5-a90a-6cd2f679fb13","resolution":{"observed_at":"2026-08-15T21:07:46.827584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.054075Z","title":"Procedure-aware surgical video-language pretraining with hierarchical knowledge augmenta- tion","venue":null,"work_id":"a3d10e19-2c37-4948-8b0d-171c472ca8eb","year":2024},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.831940Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:8f4facc8acd25222a8d4c9dc4e9d46168af5edc99e994f5fdf558a0378895dd7","observation_id":"eeeb5bef-b636-4432-aead-4b0dd1315b2e","resolution":{"observed_at":"2026-08-15T21:07:47.058805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15220","last_updated":"2025-06-16T19:07:50Z","snapshot_observed_at":"2026-08-16T15:12:40.416464Z","submitted_at":"2023-07-27T22:38:12Z","title":"Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15220","snapshot_observed_at":"2026-08-15T21:07:46.835946Z","title":"La- vanchy, Jacques Marescaux, Pietro Mascagni, Nassir Navab, and Nicolas Padoy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.835946Z"},"links":{"cited_paper":"/paper/2307.15220","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:956f675690d838364540b2f59876fe1cfcdcb627a37f1ff73ce048295b39c536","observation_id":"a28e53fd-cf19-4854-8bed-a00dceddfaeb","resolution":{"observed_at":"2026-08-15T21:07:46.835946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.038992Z","title":"Zablocki, H","venue":null,"work_id":"b5385413-a54c-4024-9ea6-fa168703f66b","year":2022},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.840469Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:bc04a4f178519878a994d0df9b74f66583c81e7c71d6d0917c5ac1056110f59c","observation_id":"821f38d1-7a0c-4ee2-907d-db88ade4234d","resolution":{"observed_at":"2026-08-15T21:07:47.043450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:47.024115Z","title":"Zeiler and Rob Fergus","venue":null,"work_id":"bcaf538a-f2a7-488c-8f2f-7350524d9d9f","year":2014},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.844819Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:c3a0c77a9e7c215e4e5047bb91107909281c982f944b800b5d7be1d53c9f84c7","observation_id":"8f331546-61d5-4cbd-8b90-abc5d7bebe77","resolution":{"observed_at":"2026-08-15T21:07:47.028914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:46.848532Z","title":"Vision-language models for vision tasks: A survey.IEEE transactions on pattern analysis and machine intelligence, 46(8):5625–5644, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.848532Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:83bf9828a9b4ded735df2ac51651a89ded8bca76e6eda96b4d8b72f55985575a","observation_id":"bfe2cdf9-2e4a-4420-ac75-f46915e17466","resolution":{"observed_at":"2026-08-15T21:07:46.848532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06579","last_updated":"2024-10-17T01:17:25Z","snapshot_observed_at":"2026-08-17T11:47:26.622673Z","submitted_at":"2024-06-04T13:52:54Z","title":"From Redundancy to Relevance: Information Flow in LVLMs Across Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06579","snapshot_observed_at":"2026-08-15T21:07:46.852698Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.852698Z"},"links":{"cited_paper":"/paper/2406.06579","citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:95a5f94b56d13e6c5bd0fdea093d28b8922e98234705fee8cb54580cb3fce04d","observation_id":"e9b8ccd5-ff8a-4537-a8ef-63e08937d4ab","resolution":{"observed_at":"2026-08-15T21:07:46.852698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:07:46.999578Z","title":"What surgical tools do you see? Choose from: Grasper, Bipolar, Hook, Scissors, Clipper, Irrigator, Bag","venue":null,"work_id":"d4db32ae-b7e8-46fe-bf82-f85551371068","year":2022},"citing_paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:46.857185Z"},"links":{"citing_paper":"/paper/2505.10764"},"observation_digest":"sha256:ced732652b160ad870b6dd1a8a88605ab7212dd97a1795e673fd37c7f2729d0a","observation_id":"83e1d77b-2aca-4948-bfc3-9c9ed7703f8b","resolution":{"observed_at":"2026-08-15T21:07:47.004475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10764","last_updated":"2026-06-25T22:32:49Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:12:18.827743Z","submitted_at":"2025-05-16T00:42:18Z","title":"SurgXBench: Explainable Vision-Language Model Benchmark for Surgery"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.10764."}