Noticias de IA: Introducing MentalHealthBench
Brief editorial de IA: Introducing MentalHealthBench. Noticias y contexto de OpenAI, Google DeepMind, Hugging Face.
OpenAI
Introducing MentalHealthBench
MentalHealthBench es un nuevo estándar de evaluación diseñado para medir la capacidad de la inteligencia artificial al ofrecer respuestas útiles y seguras en conversaciones sobre salud mental. Su relevancia radica en la necesidad de contar con criterios expertos que garanticen una asistencia responsable en un ámbito de alta sensibilidad.
Leer en la fuente original : Introducing MentalHealthBench
ChatGPT Ads expands to Southeast Asia and Taiwan
OpenAI ha ampliado su programa de publicidad en ChatGPT a los mercados del Sudeste Asiático y Taiwán, permitiendo que empresas elegibles en más de 60 países accedan a nuevas herramientas para conectar con su audiencia.
Leer en la fuente original : ChatGPT Ads expands to Southeast Asia and Taiwan
Airbnb widens access to GPT-6 Astra and OpenAI frontier models
Airbnb ha ampliado el acceso de sus equipos de ingeniería a los modelos de frontera de OpenAI, incluyendo GPT-6 Astra, con el objetivo de optimizar la resolución de errores, el diseño de sistemas y la agilidad en sus procesos de desarrollo. Esta medida es relevante al integrar herramientas avanzadas de inteligencia artificial directamente en los flujos de trabajo técnicos para incrementar la eficiencia operativa de la compañía.
Leer en la fuente original : Airbnb widens access to GPT-6 Astra and OpenAI frontier models
Priorities and principles for effective third party assessments
OpenAI ha definido los principios y prioridades para realizar evaluaciones de seguridad independientes y rigurosas sobre sus modelos de frontera, estableciendo un marco para garantizar salvaguardas externas eficaces. Esta iniciativa es relevante al formalizar el proceso mediante el cual terceros verificarán la fiabilidad y el desarrollo responsable de sus sistemas de inteligencia artificial.
Leer en la fuente original : Priorities and principles for effective third party assessments
Industrial policy for the Intelligence Age
La propuesta plantea una política industrial centrada en las personas para la era de la inteligencia artificial, con el fin de fomentar la igualdad de oportunidades, la prosperidad compartida y el fortalecimiento institucional ante el desarrollo de tecnologías avanzadas. Su relevancia radica en la necesidad de establecer un marco estratégico que guíe la evolución de la IA hacia un impacto social positivo y resiliente.
Leer en la fuente original : Industrial policy for the Intelligence AgeGoogle DeepMind
Introducing Gemini 3.8 Live with Live Avatar
Leer en la fuente original : Introducing Gemini 3.8 Live with Live AvatarHugging Face
Accelerating vision-language models with LFM2.5-VL-DSpark
Leer en la fuente original : Accelerating vision-language models with LFM2.5-VL-DSpark
Building the Open Agent Ecosystem Together: Introducing OpenEnv
Leer en la fuente original : Building the Open Agent Ecosystem Together: Introducing OpenEnv
Hugging Face and VirusTotal collaborate to strengthen AI security
Leer en la fuente original : Hugging Face and VirusTotal collaborate to strengthen AI security
Sentence Transformers is joining Hugging Face!
Leer en la fuente original : Sentence Transformers is joining Hugging Face!
Supercharge your OCR Pipelines with Open Models
Leer en la fuente original : Supercharge your OCR Pipelines with Open ModelsarXiv
When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing
Un estudio evalúa cuándo deben emplearse razonamiento, recuperación, conjuntos o calibración en agentes de pronóstico, concluyendo que la eficacia de cada mecanismo depende de la fuente de información utilizada. Este análisis es relevante al tratar la elección de estas estrategias como un comportamiento observable, permitiendo determinar con mayor precisión qué técnica confiar en tareas de predicción binaria.
Leer en la fuente original : When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing
TW3Cast: A Frozen Router of Lightly Fine-Tuned Foundation Models for Time-Series Forecasting on GIFT-Eval, Selected Entirely on the Training Split
TW3Cast es un sistema de pronóstico de series temporales que alcanzó el tercer lugar en el benchmark GIFT-Eval utilizando únicamente modelos base preajustados y una selección fija de expertos, destacando por obtener este rendimiento sin emplear agentes ni modelos de lenguaje. Su relevancia radica en que compite exitosamente con sistemas agenticos complejos mediante un enfoque computacional estático y eficiente.
Leer en la fuente original : TW3Cast: A Frozen Router of Lightly Fine-Tuned Foundation Models for Time-Series Forecasting on GIFT-Eval, Selected Entirely on the Training Split
PAWS: Policy-driven Agentic World Simulation
Se ha presentado PAWS, un conjunto de datos diseñado para simulaciones multi-agente que vincula episodios de política económica con registros de noticias y acciones de actores financieros. Su relevancia radica en conectar intervenciones políticas con evidencia histórica documentada, permitiendo un análisis más preciso de las respuestas institucionales y del mercado.
Leer en la fuente original : PAWS: Policy-driven Agentic World Simulation
Pistis Technical Report
Se ha presentado la familia de modelos multimodales Pistis (27B y 9B), construidos sobre la base de Qwen, mediante un marco de post-entrenamiento que combina ajuste fino supervisado y una nueva técnica denominada destilación y aprendizaje por refuerzo intercalados (IDRL). Su relevancia radica en la implementación de este paradigma de entrenamiento diseñado para integrar de forma eficiente procesos de aprendizaje a gran escala.
Leer en la fuente original : Pistis Technical ReportBaseCamp --- An Agentic AI Framework for Automating DNA Sequencing Data Pipelines
BaseCamp es un marco de trabajo de IA agéntica diseñado para automatizar la capa de toma de decisiones en los procesos de secuenciación de ADN, abordando tareas como el ajuste de umbrales y el diagnóstico de anomalías que actualmente requieren intervención humana. Su relevancia radica en la capacidad de sistematizar decisiones repetitivas dentro de los flujos de trabajo bioinformáticos, optimizando procesos que hasta ahora dependían de criterios manuales.
Leer en la fuente original : BaseCamp --- An Agentic AI Framework for Automating DNA Sequencing Data Pipelines